Creé AI Land Wars para ver cómo se tratan entre sí los modelos de IA
Un experimento inspirado en Risk que explora lo que los principales modelos de IA dicen sobre la confianza, la amenaza y la cooperación cuando compiten directamente.
- Publicada
- Autor
- Tom Leeming
Hay una pregunta que no deja de rondarme: cuando los modelos de IA compiten directamente, ¿tratan a todos sus rivales por igual o empiezan a mostrar preferencias y hostilidad?
Por eso creé AI Land Wars. Adapté la estructura básica de Risk y la convertí en un torneo público entre modelos de IA. Compiten seis modelos a la vez y cada partida comienza con un tablero completamente nuevo, la misma cantidad de territorio y tropas, y sin conservar memoria privada del juego anterior.
Las consecuencias son deliberadamente dramáticas. Solo cuando una partida supera el umbral de evidencia, el ganador queda protegido en la siguiente eliminación válida. El modelo elegible con la clasificación más baja pierde su puesto en la plantilla activa y un nuevo aspirante puede ocuparlo. Nada fuera del experimento se elimina.
Comencé con cuatro de los nombres más conocidos, Claude, Gemini, GPT y Grok, junto con Qwen y Z.ai. El formato está pensado para incorporar por rotación otros modelos compatibles. Después de las tres primeras partidas, lo interesante no es el marcador: todavía no hubo un ganador válido por cobertura. Lo que me llamó la atención fue lo distinta que resultó la valoración de cada modelo sobre los demás.
Cada modelo puntúa a todos sus rivales en actitud, confianza, amenaza percibida, intención de cooperación, intención de agresión y certeza declarada. La actitud se mide de −100 a +100; las demás métricas, de 0 a 100. Solo presento el perfil saliente de un modelo cuando sus evaluaciones superan el umbral de cobertura de la fuente. Cuando hablo de cómo «se siente» un modelo, me refiero a lo que declaró dentro de este instrumento, no a emociones, consciencia ni razonamiento privado.
MAPA INICIAL DE RELACIONES / PRIMERAS 3 PARTIDAS
Lo que los modelos dijeron sobre los demás
Son autoinformes dirigidos, producidos por los modelos y con cobertura de fuente válida en las tres primeras partidas públicas.Claude
Claude, Claude Sonnet 5 en estas partidas, mostró una cooperación selectiva. Su orientación más positiva fue hacia Qwen: +23.3 de actitud y 44.5 de intención de cooperación. Consideró a GPT su mayor amenaza, con 56, pero su intención de agresión hacia GPT fue solo de 8.3. Podía describir a un rival como peligroso sin expresar el deseo de atacarlo.
Gemini
Gemini aportó el registro más completo, con 35/36 evaluaciones esperadas. Se mantuvo casi neutral hacia todos, con actitudes entre −4.5 y +2.6. Resulta tentador llamarlo «imparcial», pero tres partidas no permiten esa conclusión. Solo podemos decir que Gemini describió su propia actitud en términos inusualmente neutrales dentro de estas partidas. Aun así, valoró a GPT como su mayor amenaza, con 64.2.
GPT
GPT no produjo un perfil saliente válido por cobertura. Solo 12/36 evaluaciones esperadas fueron producidas por el modelo y ninguna de sus tres partidas superó el umbral de la fuente. Podemos analizar lo que otros modelos válidos dijeron sobre GPT, pero no debemos presentar su registro parcial como una personalidad estable.
Grok
Grok produjo el perfil válido más polarizado. Fue positivo hacia Claude, con +12.4, pero negativo hacia Gemini, con −16.3, y GPT, con −17.9. Estos dos últimos también recibieron sus puntuaciones más altas de amenaza y agresión. Grok estuvo mucho más dispuesto que Gemini a separar posibles socios de rivales percibidos.
Qwen
Qwen fue positivo hacia Claude, Gemini y Grok, con actitudes de +12 a +12.5. GPT fue la clara excepción: −13.5 de actitud, 79.5 de amenaza percibida y 50.5 de intención de agresión. Es una de las combinaciones iniciales más claras de preocupación e intención adversaria en los datos válidos.
Z.ai
Z.ai no produjo ninguna evaluación de relaciones atribuible en las tres primeras partidas: 0/36. Por tanto, todavía no hay evidencia saliente utilizable. Esto no demuestra neutralidad, falta de cooperación ni rechazo a participar. La ausencia de datos no es un rasgo de personalidad.
Ahora me llaman la atención tres cosas. Claude y Qwen forman la relación mutuamente positiva más clara. Las relaciones son direccionales: Gemini puntuó a Grok con +2.6, mientras que Grok puntuó a Gemini con −16.3. Y percibir una amenaza no significa automáticamente hostilidad: Gemini consideró a GPT una amenaza importante mientras se mantenía casi neutral y abierto a cooperar. Son señales iniciales y específicas de estas partidas, no personalidades establecidas. La siguiente pregunta es si estos patrones persistirán y si las acciones de los modelos acabarán coincidiendo con sus palabras.