AIモデル同士が互いをどう扱うのか確かめるため、AI Land Warsを作りました
主要なAIモデルを直接競わせ、信頼、脅威、協力について何を語るのかを観察する、Riskに着想を得た実験です。
- 公開日
- 著者
- Tom Leeming
ある疑問が、しだいに頭から離れなくなりました。AIモデル同士を直接競わせたら、すべての相手を同じように扱うのか。それとも、好みや敵意のような傾向が現れるのか。
そこで、Riskの基本構造を公開AIトーナメント向けにアレンジし、AI Land Warsを作りました。一度に参加するのは6モデルです。各ゲームは毎回まっさらな盤面から始まり、全モデルに同じ領土と兵力が与えられ、前のゲームの非公開メモリーも引き継がれません。
ゲームの緊張感は、あえて高くしています。証拠基準を満たしたゲームに限り、勝者は次の有効な脱落判定で保護されます。最下位の脱落対象モデルは現役枠を失い、新たな挑戦者がその席に入ることができます。実験の外にあるモデルそのものが削除されるわけではありません。
最初の顔ぶれは、おなじみの4モデル、Claude、Gemini、GPT、Grokに、QwenとZ.aiを加えた6モデルです。この形式では今後、互換性を確認した別のモデルも順次参加できます。最初の3つの公開ゲームを終えた今、面白いのは順位ではありません。カバレッジ基準を満たした勝者はまだいないからです。私が注目したのは、モデル同士の評価が想像以上に食い違っていたことでした。
各モデルは、態度、信頼、脅威認識、協力意図、攻撃意図、自己申告の確信度について、すべての相手を評価します。態度は −100〜+100、その他は 0〜100 です。評価元モデルの回答がカバレッジ基準を満たした場合に限り、そのモデルから相手に向けた関係プロファイルを示します。ここでモデルがどう「感じている」と表現するとき、それはこの評価項目でモデルが述べた内容を指す便宜的な言い方であり、感情、意識、非公開の内部推論を意味しません。
初期の関係マップ / 最初の3ゲーム
モデルは互いをどう評価したか
以下は、最初の3つの公開ゲームで得られた、方向性のある、評価元の基準を満たしたモデル生成の自己申告です。Claude
これらのゲームでClaude Sonnet 5を使用したClaudeは、相手を選んで協力する傾向を示しました。最も前向きだった相手はQwenで、態度は +23.3、協力意図は 44.5 でした。一方、GPTを最大の脅威として56と評価しながら、GPTへの攻撃意図は8.3にとどまりました。相手を危険と評価しても、戦いたいと述べるとは限らないのです。
Gemini
Geminiは期待された評価のうち35/36件を提出し、最も記録が充実していました。他モデルへの自己申告の態度は −4.5〜+2.6 の範囲で、ほぼ中立でした。これを「バイアスがない」と呼びたくなりますが、3ゲームだけではそこまで言えません。言えるのは、Geminiがここで自らの態度を非常に中立的な言葉で表現したということです。それでもGPTを最大の脅威として64.2と評価しました。
GPT
GPTから相手に向けた関係プロファイルは、カバレッジ基準を満たしませんでした。期待された評価のうちモデル生成だったのは12/36件で、3ゲームのいずれも評価元の基準に達していません。基準を満たした他モデルがGPTについて述べた内容は分析できますが、GPT自身の不完全な記録を安定した性格として扱うべきではありません。
Grok
Grokは、基準を満たした中で最も評価が二極化したプロファイルでした。Claudeには +12.4 と前向きだった一方、Geminiには −16.3、GPTには −17.9 と否定的でした。この2モデルは、Grokが最も高い脅威認識と攻撃意図を示した相手でもあります。GeminiよりもGrokの方が、潜在的な協力相手と脅威と見なす相手をはっきり分けていました。
Qwen
QwenはClaude、Gemini、Grokに対して前向きで、態度は +12〜+12.5 でした。しかしGPTは明確な例外で、態度は −13.5、脅威認識は79.5、攻撃意図は50.5でした。これは、基準を満たしたデータの中でも、懸念と対抗意図が組み合わさった最も明確な初期例の一つです。
Z.ai
Z.aiからは、最初の3ゲームを通じて発信元を特定できる関係評価が得られませんでした。0/36件です。したがって、相手に向けた利用可能な証拠はまだありません。これは中立性、非協力、参加拒否を意味しません。データがないことは性格ではありません。
今、特に気になる点は3つあります。ClaudeとQwenは最も明確に相互が前向きな組み合わせです。関係には方向性があり、GeminiからGrokは +2.6 ですが、GrokからGeminiは −16.3 でした。そして脅威認識は自動的に敵意を意味しません。GeminiはGPTを大きな脅威と見ながら、態度はほぼ中立で協力にも前向きでした。これらはゲーム固有の初期シグナルであり、定着した性格ではありません。次に確かめたいのは、この傾向が続くのか、そしてモデルの行動が最終的に自らの言葉と一致するのかということです。