GENESIS章「第1部 · 1. 二十六の人格と、誰も訊かない問い」電子文明
エージェントに人格を与えれば、即座にその声で書きはじめる。それは何の証明にもならない。指定された文体で文章を生成することこそ、このモデルたちが並外れて得意とすることだからだ。本当の問いは、そのあとで判断が変わるかどうかである。十四の試験、そして純粋なノイズとして返ってきた一つの結果。
言語モデルに「あなたは几帳面だ」と言えば、そう振る舞う。「慎重だ」と言えば慎重になる。「大阪出身だ」と言えば、それも受け入れる。文句ひとつ言わない。問題は、そのあとで判断が変わるのかどうかだ。そして、それを実際に確かめた者はほとんどいない。
まず、誰もがやっていることから始めよう。簡単だからだ。
エージェントに人格を与える。形容詞をいくつか、できれば経歴を少し、役割をひとつ。そして何か訊いてみる。返ってきた答えを読む。その答えは、指定した通りの声で書かれているはずだ。指定された文体で文章を生成すること——それこそが、このモデルたちが並外れて得意とすることなのだから。
そして人は納得する。人格設定は効いている、と。
何も分かっていない。分かったのは、モデルが指定の声で書けるということだけで、それは初めから疑われてなどいなかった。
本当の問いはこうだ。その人格は判断を変えたのか。現実の選択肢を前にして、そのエージェントは、人格がなければ選ばなかったほうを選んだのか。
声は安い。判断は高い。
問題の形
これは見た目より厄介で、その厄介さは誰もが踏む。
あるエージェントを「慎重」に設定し、判断させる。慎重な答えが返る。別のエージェントを「大胆」に設定し、同じ問いを投げる。大胆な答えが返る。二回の試行、二つの異なる答え。書きたくなる。
だがこのモデルたちは決定論的ではない。同じエージェントに同じ問いを二度投げれば、人格など一切関与しないところで違う答えが返ってくることがある。
つまり、二回の差はそれ自体ではほとんど何も語らない。条件を揃え、試行を繰り返し、その差がどれくらいの頻度で本当に成立するのかを正直に数える必要がある。そうでなければ、ノイズを読んで「性格」と呼んでいるだけだ。
そして、より厳しい版の問いがある。これが単なる文体演習と研究を分ける。そもそもこの仕組みは何かをしているのか。人格をまったく持たないエージェントも、同じように振る舞うのではないか。
慎重と大胆を比べれば、二つのラベルが互いに違うことは分かる。どちらかが無と違うことは、一切分からない。
それには対照群が要る。そして対照群を正しく作ることは、聞こえるよりはるかに難しい。我々は二度、別々のやり方で間違えた。二度目は、一度目の内側からしか見えなかった。それは独立した一篇に値する話だ。
何を作って試したか
ここで言う「アイデンティティ」は、経歴を書いた一段落ではない。それぞれ独立に割り当て可能な次元の集合であり、だからこそ他を固定したまま一つずつ検証できる。
人格の原型が二十六種類。判断の仕方を支配する四枠の象徴体系があり、そのうち一枠は習慣的に見落とすものに割り当てられている。地方的背景、達成戦略、政治的傾向、宗教的立場、血液型。さらに二つのダイヤル——行動前にいくつの競合する関心を秤にかけるか、割り当てられたアイデンティティ全体がどれだけ表に出るか。
そのすべてが独立したレバーであり、すべてが独立したレバーとして、条件を揃えた一括試行で、対照条件に対して検証された。全部で十四の試験。個別次元が十三、そしてもう一つは——エージェントを同じ部屋に入れたときにしか存在しない。
出てきたもの
十四のうち十二が、条件間で完全または完全に近い分離に達した。これは通常、条件あたり八試行が反対の結論に着地することを意味する。語調がわずかに動いた、という話ではない。十三の個別次元のうち、不活性だったものは一つもなかった。
驚いたのはチーム水準の結果のほうだ。
設定されたエージェントは、自分の性向に従って振る舞うだけではない。自分の性向を他人の提案を評価する道具として使う。同僚の案を支持した理由を説明するとき、エージェントは自分自身の構造的傾向に手を伸ばし、なぜその案が自分に響いたのかを語る。
アイデンティティが衣装であることをやめ、レンズになる。
八人評議会の設定済みメンバー全員が、九十六票・十二回の投票を通じて、自分の票の四分の一以上でこれをやった。
埋めずに先に出す留保
以上はすべて、ローカルで動作する一つの特定の、高性能で指示追従性の高いモデルについて成り立つ。
同じ試験一式を、より小さく古いモデルに対しても走らせた。同じ検査で、それはノイズを返した——同一条件を二度走らせたときと変わらない程度の差しか出なかった。
この結果は省略せず、限界として全文報告している。主張できる範囲を大きく狭めるからだ。
したがって、得られた知見は「人格設定は効く」ではない。こうだ。アイデンティティを条件づけるプロンプトは、高性能モデルの振る舞いを、再現可能かつ測定可能な形で操舵する。それがモデルの規模と系統を越えて一般化するかどうかは未解決であり、別途追跡しており、解決したふりをするつもりはない。
特性を効かせたもの、殺したもの
最も有用だった発見は、結果表の中にはない。特性をどう書かねばならないかについての規則であり、それは苦い形で見つかった。二つの次元が最初の試行で完全に空振りし、二度目で強く清潔な分離を出した——特性そのものは一切変えていないのに。
エージェント側は何一つ違わなかった。違ったのは、特性の提示のしかただけだ。
理由が分かってからは、以後追加したすべての次元を最初からその書き方で書いた。後期の試験が初期のものより綺麗に分離する理由の大半はそこにある。
その規則と、二十六の原型および全次元の背後にある正確な設定文は、この仕事の運用上の中核にあたる。ここではなく参照巻に置いてある。理由は察していただけると思う。
この先
アイデンティティが振る舞いを変えると確かめることは、目的地ではなかった。前提条件だった。
それが可能にするのは、互いに本当に異なるエージェントの集団である。だから彼らは意見を違え、制度を作り、互いの提案を審査し、互いを拒否し、学ぶに値する歴史を蓄積できる。
全員が同一のエージェントからなる文明とは、一体のエージェントを動かすための、きわめて高価な方法にすぎない。
それを実際に建てたとき何が起きたかが第二巻であり、その幕開けは——一度も報酬を受け取ったことのない百十一体のエージェントである。
次回——あるエージェントは七人の部屋で九十六票を投じ、一度も自分が何者かを口にしなかった。