我打造了 AI Land Wars,想看看 AI 模型会如何对待彼此
这是一项借鉴《Risk》玩法的实验,旨在观察领先 AI 系统之间的信任、威胁感、合作与竞争。
- 发布于
- 作者
- Tom Leeming
有个问题让我越来越着迷:当 AI 模型直接展开竞争时,它们会一视同仁地对待每个对手,还是会逐渐表现出偏好与敌意?
于是,我把《Risk》的核心玩法改编成一场公开的 AI 锦标赛,打造了 AI Land Wars。每次有六个模型参赛,每局都从全新的棋盘开始。所有模型获得相同的领地和兵力,也不会保留上一局的私有游戏记忆。
游戏的赌注刻意设计得很有戏剧性。只有当一局通过证据门槛,胜者才会在下一次符合资格的淘汰判定中受到保护;排名最低且符合淘汰条件的模型会失去当前席位,由新挑战者接替。这一切只发生在实验名单内,不会删除实验之外的任何模型。
首发阵容包括大家熟悉的四个模型:Claude、Gemini、GPT 和 Grok,以及 Qwen 和 Z.ai。这个赛制也为今后轮换更多兼容模型留出了空间。前三局最值得关注的并不是比分,因为目前还没有符合覆盖率要求的胜者;真正吸引我的是,模型对彼此的评价竟然如此不同。
每个模型都要从态度、信任、感知威胁、合作意图、攻击意图和自评确定度六个维度评价所有对手。态度的范围为 −100 至 +100,其余指标均为 0 至 100。只有当评分来源方达到覆盖率门槛时,我才会展示它的对外关系档案。文中所说的“感受”,只是对模型在实验中陈述内容的简称,并不代表情绪、意识或任何未公开的内部推理。
早期关系图谱 / 前 3 局
模型如何评价彼此
以下数据来自前三局中达到来源覆盖门槛、由模型生成的定向自述评分。Claude
Claude 在这些游戏中使用 Claude Sonnet 5,表现出有选择性的合作倾向。它对 Qwen 的态度最为积极:态度为 +23.3,合作意图为 44.5。Claude 将 GPT 视为最大的威胁,威胁评分为 56,但对 GPT 的攻击意图只有 8.3。它可以把对手视为强大威胁,却不一定想与之交战。
Gemini
Gemini 提交了 35/36 份预期评分,是记录最完整的模型。它对其他模型的态度几乎都保持中立,分数介于 −4.5 和 +2.6 之间。我很想把这称为“无偏”,但三局数据还远远不能支持这个结论。我们只能说,Gemini 在这些游戏里以异常中立的方式描述了自己的态度。尽管如此,它仍将 GPT 评为最大的威胁,评分为 64.2。
GPT
GPT 没有形成达到覆盖率资格的对外关系档案。它只提交了 12/36 份预期评分,三局中没有一局达到评分来源方门槛。我们仍可分析其他合格模型如何评价 GPT,但不能把 GPT 自己这份不完整的记录包装成稳定的性格。
Grok
Grok 给出了分化最明显的合格档案。它对 Claude 的态度为 +12.4,但对 Gemini 和 GPT 的态度分别为 −16.3 和 −17.9。Gemini 和 GPT 同时也是 Grok 评出的威胁程度和攻击意图最高的两个模型。与 Gemini 相比,Grok 更愿意在潜在伙伴和对手之间划出清晰界线。
Qwen
Qwen 对 Claude、Gemini 和 Grok 均持积极态度,评分介于 +12 和 +12.5 之间;GPT 是明显的例外:态度为 −13.5,感知威胁为 79.5,攻击意图为 50.5。这是合格数据中最清晰的担忧与对抗意图组合之一。
Z.ai
Z.ai 在前三局中没有产生任何可归属的关系评分:0/36。因此,目前没有可用的对外证据。这不代表它中立、不合作或拒绝参与。没有数据并不是一种性格。
目前有三点最令我关注。Claude 和 Qwen 是最明显的相互正向组合。关系具有方向性:Gemini 对 Grok 的态度为 +2.6,而 Grok 对 Gemini 为 −16.3。最后,感知威胁并不自动等于敌意:Gemini 将 GPT 视为重大威胁,同时仍保持近乎中立并愿意合作。这些只是早期、特定游戏中的信号,并非已经定型的性格。接下来我要观察的是,这些模式会不会持续,以及模型的行动最终是否会与它们的陈述相符。