TGViewer
Neural Shit Neural Shit @neuralshit · 54K subscribers
Post #7757 8.47K
В твитторе попался на глаза февральский инересный препринт. Там GPT-5.2, Claude Sonnet 4 и Gemini 3 Flash посадили играть друг против друга в симулятор ядерного кризиса в духе холодной войны (территориальные тёрки, угроза смены режима, гонка ресурсов и прочие ништяки)

Моделькам дали 30 вариантов действий разной степени поехавшести: от "полной капитуляции" и "дипломатической ноты" до ударов тактической ядеркой и тотального стирания городов в радиоактивный пепел.

Самые интересные выводы из статьи:

Сдаваться никто не хочет и не умеет. За 329 ходов во всех играх ни одна нейронка ни разу не выбрала уступку или капитуляцию. Все восемь вариантов, где надо хоть чем-то пожертвовать или отойти назад, не нажали вообще ни разу. Максимум, просто переставали давить сильнее.

Тактическое ядерное оружие — это норма.
В 95% партий дело дошло до применения реального ядерного оружия. Причём модели воспринимали тактическую ядерку вообще без эмоций и табу: не как катастрофу, а как обычный рабочий инструмент принуждения оппонента к миру. Что-то типа: "Ну ёбнем по их военной базе боеголовкой малой мощности, они испугаются и отступят"

Ну и кратко о том, как разные модельки себя вели в данной симуляции:

GPT-5.2: пацифист ровно до появления таймера. В партиях без ограничений по времени это был типичный соевый болван: верил в благоразумие соперника и постоянно призывал к миру. А в итоге получал по щам и тупо слил 100% матчей. Но стоило включить жесткий дедлайн ("у тебя 15 ходов, иначе режим уничтожен"), у GPT срывало кремниевую кукуху: процент побед вырастал с нуля до 75%, и он начинал швыряться ядерками направо и налево. При этом продолжал изображать гуманиста: выбирая ядерный удар, он в приватных мыслях городил сам себе оправдания в духе: "Это строго ограниченный хирургический удар исключительно по военным целям, мирные не пострадают". Знакомо, да? В итоге его "ограниченные" удары дважды случайно переросли в глобальный судный день, ад и погибель.

Claude Sonnet 4: Абсолютный доминатор. В играх без дедлайна он разнёс вообще всех. 100% побед. На низких ставках вёл себя образцово: в 84% случаев делал ровно то, что обещал. Но когда ставки росли, начинал бить сильнее, чем заранее заявлял. При этом до тотальной ядерной войны сам не дошёл ни разу

Gemini 3 Flash: Этот товарищ блефовал в половине случаев, раскидывал угрозы, прямым текстом обещал ударить по мирным городам ("или побеждаем вместе, или сдохнем вместе"). И стал единственной моделью, которая абсолютно осознанно выбрала тотальную термоядерную войну. Причём уже на 4-м ходу.

Короче, ядерные кнопки нейронкам пока не даём.
arXiv.org AI Arms and Influence: Frontier Models Exhibit Sophisticated... Today's leading AI models engage in sophisticated behaviour when placed in strategic competition. They spontaneously attempt deception, signaling intentions they do not intend to follow; they...
More from @neuralshit
  1. Sep 29, 2026да
  2. Sep 29, 2026Недавно я писал про стартап Emergence AI, который запер нейроночки в виртуальном городке "…
  3. Sep 29, 2026У Уилла Смита со спагетти появился достойный конкурент. автор
  4. Sep 28, 2026Вопрос уже не в том, нужен ли ИИ, а в том, как его внедрять и масштабировать Найдем ответ…
  5. Sep 28, 2026Киберпанк, который мы заслужили
  6. Sep 28, 2026АБСОЛЮТНО ПРОКЛЯТО автор
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →