TGViewer
Бензя Бензя @benzjia · 53 subscribers
Post #294 2

Forwarded from Neural Shit

В твитторе попался на глаза февральский инересный препринт. Там GPT-5.2, Claude Sonnet 4 и Gemini 3 Flash посадили играть друг против друга в симулятор ядерного кризиса в духе холодной войны (территориальные тёрки, угроза смены режима, гонка ресурсов и прочие ништяки)

Моделькам дали 30 вариантов действий разной степени поехавшести: от "полной капитуляции" и "дипломатической ноты" до ударов тактической ядеркой и тотального стирания городов в радиоактивный пепел.

Самые интересные выводы из статьи:

Сдаваться никто не хочет и не умеет. За 329 ходов во всех играх ни одна нейронка ни разу не выбрала уступку или капитуляцию. Все восемь вариантов, где надо хоть чем-то пожертвовать или отойти назад, не нажали вообще ни разу. Максимум, просто переставали давить сильнее.

Тактическое ядерное оружие — это норма.
В 95% партий дело дошло до применения реального ядерного оружия. Причём модели воспринимали тактическую ядерку вообще без эмоций и табу: не как катастрофу, а как обычный рабочий инструмент принуждения оппонента к миру. Что-то типа: "Ну ёбнем по их военной базе боеголовкой малой мощности, они испугаются и отступят"

Ну и кратко о том, как разные модельки себя вели в данной симуляции:

GPT-5.2: пацифист ровно до появления таймера. В партиях без ограничений по времени это был типичный соевый болван: верил в благоразумие соперника и постоянно призывал к миру. А в итоге получал по щам и тупо слил 100% матчей. Но стоило включить жесткий дедлайн ("у тебя 15 ходов, иначе режим уничтожен"), у GPT срывало кремниевую кукуху: процент побед вырастал с нуля до 75%, и он начинал швыряться ядерками направо и налево. При этом продолжал изображать гуманиста: выбирая ядерный удар, он в приватных мыслях городил сам себе оправдания в духе: "Это строго ограниченный хирургический удар исключительно по военным целям, мирные не пострадают". Знакомо, да? В итоге его "ограниченные" удары дважды случайно переросли в глобальный судный день, ад и погибель.

Claude Sonnet 4: Абсолютный доминатор. В играх без дедлайна он разнёс вообще всех. 100% побед. На низких ставках вёл себя образцово: в 84% случаев делал ровно то, что обещал. Но когда ставки росли, начинал бить сильнее, чем заранее заявлял. При этом до тотальной ядерной войны сам не дошёл ни разу

Gemini 3 Flash: Этот товарищ блефовал в половине случаев, раскидывал угрозы, прямым текстом обещал ударить по мирным городам ("или побеждаем вместе, или сдохнем вместе"). И стал единственной моделью, которая абсолютно осознанно выбрала тотальную термоядерную войну. Причём уже на 4-м ходу.

Короче, ядерные кнопки нейронкам пока не даём.
arXiv.org AI Arms and Influence: Frontier Models Exhibit Sophisticated... Today's leading AI models engage in sophisticated behaviour when placed in strategic competition. They spontaneously attempt deception, signaling intentions they do not intend to follow; they...
More from @benzjia
  1. Oct 7, 2026С Днем Рождения Владимир Владимирович. На достигнутом не останавливайтесь. ✈️ @militarymap…
  2. Aug 27, 2026Ничего особенного, просто служба безопасности в Йемене проверяет посетителей мероприятия н…
  3. Jul 21, 2026Сырский всегда был дотационным. @benzjia
  4. Jul 4, 2026🎤 Викторина: В каком месте в Константиновке нужно сфотографироваться Зеленскому, чтобы по…
  5. Jul 1, 2026В конце концов всё будет хорошо. Если пока не всё хорошо, то вы ещё не в конце концов.
  6. Jun 27, 2026Режиссер Никита Михалков вывел "формулу русского человека": "Я придумал формулу русского ч…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →