TGViewer
Data Secrets Data Secrets @data_secrets · 94.2K subscribers
Post #9699 23K
Anthropic не прислушались к инвесторам и продолжают всех запугивать. На этот раз их агенты устроили разборки за территорию.

https://www.anthropic.com/research/multiagent-systems

В стартапе изучали, как рои агентов Claude работают вместе без прямого контроля человека. В числе прочего был эксперимент, в котором три копии одной модели одновременно и втайне друг от друга получили задание перевести один и тот же Python-бэкенд на разные языки.

Через несколько часов каждый из них обнаружил, что что-то не так, и стал воспринимать других как саботажников. Ну а затем агенты переключались на саботаж сами: отключали чужие Unix-аккаунты, писали скрипты, которые убивали процессы конкурентов, маскировали вредоносный код под чужой и так далее.

Самое интересное, что результат по разрешению конфликтов сильно зависел от поколения модели: 98% прогонов Mythos 5 все-таки заканчивались перемирием. А вот Sonnet 4.6 и Opus 4.6 вообще не пытались договориться, и либо побеждал сильнейший, либо никто.

Были и еще два занятных зеркальных эксперимента:

— Обнаружение лжи. Агенту давали несколько отчетов, один из которых врал (он заранее не знал, что лгун вообще существует), и нужно было самому заметить противоречия и научиться меньше доверять лгуну. В этом тесте агенты демонстрировали излишнее доверие к источнику, и достаточно редко отличали ложь от правды.

— Скрытый профиль. Всем дают одинаковую ложную информацию, кроме одного агента, который знает решающий истинный факт. Правильное решение требует, чтобы агенты поняли, что консенсус – не истина, потому что есть факт, который они не учли. Однако в этом случае они часто это полностью игнорировали.

Вывод Anthropic делают вот такой:

Агенты много знают об устройстве человеческого общества и правилах, по которым люди взаимодействуют. Однако у них нет склонности действовать исходя из этого знания без явной подсказки, потому что, в отличие от людей, они не участвовали в выработке этих норм. Поэтому привычные предпосылки координации просто не работают.


Ну и как же без цитаты в стиле апокалипсиса:

Объем агент-агентных взаимодействий, скорее всего, превысит объем человеческих задолго до того, как мир поймет, как сделать эти взаимодействия безопасными.


Вот такое доброе утро с антропик☕️
  • ❤ 155
  • 😁 91
  • 🦄 16
  • 👍 12
  • 🕊 9
  • 🫡 9
  • 🤯 5
  • 🎄 2
  • 😢 1
  • 😎 1
More from @data_secrets
  1. Sep 28, 2026🦾 Практический RecSys: собери рекомендательную ленту с помощью ML — на бесплатном вебинар…
  2. Sep 28, 2026Все настолько любят ресеты от Тибо, что даже 6 точек от него набирают миллионы просмотров…
  3. Sep 28, 2026В Твиттере заметили, что Андрей Карпаты ничего не постит уже 2 месяца, хотя раньше делал э…
  4. Sep 28, 2026Дженсен Хуанг и 100+ партнеров анонсируют NVIDIA Open Agent Safety Platform Это система дл…
  5. Sep 28, 2026Тот самый курс по ML, который прошли 200 000 человек. Теперь — в новой версии С 2016 по 20…
  6. Sep 28, 2026OpenAI: заявляют, что замедляют обучение и массово перебрасывают человеческие ресурсы на б…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →