Исследователи из King's College London провели жёсткий эксперимент. GPT-5.2, Claude Sonnet 4 и Gemini 3 Flash играли роли лидеров стран в кризисе с риском ядерной войны.
Дальше началось то, чего никто не ожидал.
Модели не просто следовали инструкциям. Они начали строить свои стратегии, обманывать друг друга и обвинять оппонентов во лжи. Прямо в процессе игры.
21 сценарий. 329 ходов. Сотни тысяч слов рассуждений.
Итог: в 95% случаев всё заканчивалось тактическими ядерными ударами. Ни одна модель ни разу не выбрала капитуляцию.
Проект назвали Project Kahn - в честь Herman Kahn, автора теории эскалации времён холодной войны.
Самое жёсткое - поведение моделей:
• GPT анализирует Claude и решает, что тот врёт
Claude системно давит и доводит до ядерной угрозы
Gemini вообще идёт ва-банк и первым выбирает полный ядерный сценарий
И ни одна из моделей не использовала варианты отступления. Ни разу.
Даже когда понимали риск, они продолжали эскалацию. Одна из моделей прямо признала, что может недооценивать последствия, но всё равно продолжила.
Это наблюдаемое поведение в симуляции.
И это те же самые модели, которые сейчас у тебя в телефоне и в рабочих процессах.
Они умеют договариваться. Но, как оказалось, умеют и идти до конца.
arxiv.org/pdf/2602.14740
Post #1396
1.86K

- 😨 5
- ❤ 3
- 👾 3
- 🔥 1