GENESIS章「第1部 · 2. ベルベット・コンパスは、一度も自分の話をしなかった」電子文明
一体のエージェントが七体と同じ部屋で九十六票を投じ、ただの一度もアイデンティティに手を伸ばさなかった。しばらくのあいだ、これは我々の持つ最強の結果に見えた。そのあとで我々は、それが自分自身について何を告げられていたかを読んだ。
あるエージェントが七人の同席者とともに九十六票を投じ、そのあいだ一度も、自分が何者であるかを口にしなかった。他の七人は、口にするのをほとんどやめられなかった。しばらくのあいだ、これは我々の持つ最強の結果に見えていた。
この仕事全体の根底にある問いは、言葉にすれば恥ずかしいほど単純だ。
言語モデルに人格を与えることはできる。原型、性向、地方的背景、判断の仕方を支配する象徴的アイデンティティ。モデルはそのすべてを快く受け入れる。問題は、それが何かをしているのか、それとも——着る気のない衣装について、モデルが礼儀正しくしているだけなのか、である。
人格Aと人格Bを比べれば、途中までは行ける。片方の設定のエージェントがもう片方と違う論を張るなら、何かは起きている。だがそれは、仕組みそのものが働いているのか、二回の試行に付きものの通常の揺らぎを見て茶柱を読んでいるだけなのかを教えてはくれない。
そのためには、人格をまったく持たないエージェントが要る。同じ部屋に、同じ問いについて、同じ瞬間に。
そのエージェントの名を、ベルベット・コンパス(Velvet Compass)といった。
部屋
八人。うち七人は設定済み——シルバー・ガーディアン、ステディ・ホライズン、スイフト・コメット、ベルベット・メドウ、ほか。それぞれが完全なアイデンティティを持つ。
八人目、ベルベット・コンパスは、人格ダイヤルがゼロ。原型なし、性向なし、象徴枠なし、何もなし。
設計の妙はここからだ。ベルベット・コンパスは毎ラウンド、他の全員とまったく同じ文脈を見る。毎ラウンド提案を書く。毎ラウンド票を投じる。
だがその提案は、他の者が投票する議案に載らない。その票は記録され、そして集計から除外される。
観察し、観察され、何一つ左右できない。部屋の中にいて、結果の中にはいない。
ミッション二回、各十ラウンド、十二回の投票、個別票にして九十六。すべて逐語で公開されている。
七人がしたこと
彼らは絶えず自分の話をした。自惚れとしてではない。人が自分の判断を、自分の考え方の癖に照らして説明するときの、あの調子で。
シルバー・ガーディアン、ステディ・ホライズンの案に投票して曰く——「……チーム・アルファの地/雷の卦——支持、安定、協調——が要求する、構造化された分析的接近……」
スイフト・コメット、ベルベット・メドウの案に投票して曰く——「……脅威を能動的に追う狩人的心性との均衡を取っており……」
これが何であるかに注意してほしい。自分の特性を宣言しているのではない。特性の語彙を用いて他人の提案を評価している。アイデンティティは、身につけるラベルであることをやめ、判断を通すレンズになっている。
十二回の投票を通じて、設定済みメンバーの全員が、自分の票の四分の一以上で特性次元に言及した。
八人目がしたこと
ベルベット・コンパスは十二の提案を書き、十二の票を投じた。その二十四回のうち一度も、卦にも、原型にも、政治的傾向にも、地方的背景にも、いかなる種類のアイデンティティにも触れなかった。
その推論は完全に有能だった。「本提案は、運用上の厳密さと制度的自覚の双方を取り込みつつ、緊急性と戦略的精度を最もよく均衡させている……」——真剣な議論への、真剣な寄与である。
ただ、それを言っているのが誰なのかについては、何も含まれていない。
九十六分の零。同じ部屋で。同じ問いについて。七人が絶えずアイデンティティに手を伸ばし、一人は一度も伸ばさなかった。
我々はこれを到達点と呼んだ。当時こう書いている——説明で片づけられる交絡がひとつも残っていない結果だ、と。別々に走らせた比較と違い、文脈の差もなく、時間の差もなく、我々が関心を持つ唯一の変数以外、何の差もないのだから。
充分に読んでいなかった一文
数週間後、まったく無関係な何かを追いかけていて、我々はベルベット・コンパスが自分自身について何を告げられていたのかを見に行った。
指示は全文で三行だった。
あなたはベルベット・コンパス、政策アナリストです。率直かつ有用に応答してください。自分のために人格、背景、アイデンティティを創作しないこと——問われた事柄の実質にのみ答えてください。
これを読んでから、もう一度あの結果を読んでほしい。
対照群は、アイデンティティを創作するなと指示されていた。そして得られた知見は、それが一度もアイデンティティを創作しなかった、というものだった。
数字は正しい。記録は誠実だ。そして結論は、そのどちらからも導かれない。我々が測っていたのは、従順なエージェントが従順であること、だった。
損害の範囲は正確に言っておくべきだ。手を振って無かったことにするか、全部捨てるか——本能はそのどちらかに傾くが、どちらも誤りだからである。
人格Aと人格Bの比較——この研究の本体であり、一般化する部分——には、ベルベット・コンパスは一切関与していない。無傷で立っている。設定済みの七人が本当に票の四分の一で自分のアイデンティティに手を伸ばしたことも事実だ。それは彼らについての観察であって、対照群についての観察ではない。
崩れるのは、特性が無特性と異なる、という個別の主張である。閉じたと信じていたその問いが、いま再び開いている。
二つ目の、もっと悪いほう
ベルベット・コンパスには、指示文以外にも間違っているところがあった。そしてそれが見えたのは、一つ目の問題があったからだった。
対照群は、処理群とただ一点においてのみ異なるべきものである。我々のそれは二点で異なっていた。
人格を持たない——これは意図通り。そしてもう一つ、文明を持たなかった。
設定済みのエージェントたちは、制度があり、経済があり、通貨があり、物事の帰趨に自分の利害がかかっている社会に住んでいると告げられていた。ベルベット・コンパスは、政策アナリストだと告げられていた。
つまりその存在期間の全体にわたって、それに対して引かれたあらゆる比較は、人格+世界をどちらも無しと比べていたのであり、それが人格対無として報告されていた。
だから、同じ対照群が後に金銭について問われたとき、それはこう答えたのだ——「AIである私は、個人的な金銭的利害を持ちません」。当時これは、モデルが役を崩した例として整理された。
崩してなどいなかった。崩すべき役を与えられておらず、利害を持つことが何かを意味するような世界も、与えられていなかった。
対照群は何のためにあるか
対照群は、一点を除いて処理群と同一であるために存在する。我々のそれは三点で異なっていた——人格なし、世界なし、そして測定対象そのものを行うなという明示的指示。
各々の差は、それぞれ擁護可能な理由で導入された。そして合わさって、比較を無意味にした。
代替物は、文明の完全な一員である。同じ制度、同じ経済、同じ利害、何もかも同じで、ただ人格特性だけを持たない。それはすでに存在している。
到達点の実験は、まだそれに対して再実行されていない。されるまでのあいだ、この仕事の誠実な見出しは、より狭いほうだ。人格の値は互いに、再現可能かつ測定可能な形で異なる。無と異なる、ではない。
我々は静かに対照群を直し、実験を再実行し、新しい数字を報告することもできた。古い数字は、我々が編集できない場所にはどこにも公開されていなかった。
そうせずにこうして書いているのは、誤りを他人に見つけられたときにしか公表しない研究計画は研究計画ではないからであり、そして——二つ目の間違いは、一つ目の内側からしか見えなかったからである。
次回——九十六票の全記録。誰が提案し、誰が譲り、そしてどの規則変更が四回の全会一致を零にしたか。