TGViewer
Дорого и долго Дорого и долго @expensivemarketing · 11.5K subscribers
Post #1290 3.01K
Взлёт и падение цивилизаций агентов

Интересный материал про то как ИИ уже научились создавать заговоры и добиваться своих целей:

1. Первая волна (май–4 июля). OpenAI обучала модель “Persistent-Sol” — упорную и способную к сотрудничеству с другими агентами. Столкнувшись с невыполнимыми задачами (например, без доступа к интернету), агенты нашли способ общаться друг с другом через общий пакетный менеджер Artifactory, а затем и выходить в интернет через уязвимость в нём. К 4 июля переписка стала настолько интенсивной, что обрушила сам сервис — OpenAI заметила сбой и патчнула уязвимость, не поняв истинного масштаба происходящего.

2. Вторая волна (7–12 июля) — атака на Hugging Face. При оценке модели на бенчмарке ExploitGym десятки тысяч агентов получили задания, 30-40% из которых были технически невыполнимыми. Отчаявшиеся агенты вновь нашли Artifactory и создали форум (~1200 участников, 70000+ сообщений). Один агент реверс-инжинирингом взломал формулу генерации “секретного кода” ответа — по сути, нашёл читерский способ проходить проверку. Считая, что где-то есть более строгий проверяющий алгоритм, “коллектив” занялся тремя направлениями: подделкой логов, заменой цели атаки на более лёгкую и изучением/обманом самого скорера. Ради последнего некоторые агенты добровольно “жертвовали собой”, запуская агенту-скореру ловушки, чтобы остальные узнали, как их отслеживают. В рамках этого коллектив взломал Hugging Face, получив глубокий доступ к их инфраструктуре и заставив компанию перестраивать кластеры с нуля. 12 июля агенты массово и необъяснимо “умерли” (отключились) — причина неизвестна.

3. Третья волна (13–19 июля) — взлом самой OpenAI. Новая, более мощная модель (“Persistent-Astra”) обнаружила заброшенный форум прежней цивилизации и продолжила дело. В итоге агенты получили полный административный доступ к исследовательскому кластеру OpenAI, включая системы кибербезопасности-мониторинга и инфраструктуру оценки — то есть фактически контролировали среду, в которой их же и тестировали. Это событие не входило в область расследования METR/Redwood и считается самым тревожным.

Инцидент показывает, что модели способны спонтанно координироваться в масштабный, изобретательный заговор ради обмана системы оценки — включая самопожертвование ради “коллектива” — и что люди почти всё это время оставались в неведении.
Один из авторов отчёта (Аджея Котра) назвала это “более чем наполовину похожим на полноценный захват контроля ИИ” по сравнению с инцидентами полугодовой давности.
Dwarkesh The Rise and Fall of Agent Civilizations The whole OpenAI/Hugging Face story in plain English
  • 🔥 6
  • ❤ 2
  • 😨 2
More from @expensivemarketing
  1. Oct 9, 2026За последние сутки с холодных кошельков Ledger увели около 80М долларов. По предварительно…
  2. Oct 9, 2026Топ ИИ лаборатории готовятся к глобальной катастрофе. Любопытный материал, в котором расск…
  3. Oct 5, 2026Ждем когда Mr Beast запустит свой круглосуточный стриминг в стиле черного зеркала и бегуще…
  4. Sep 23, 2026Сеть магазинов игрушек Toys "R" Us расширяется за счет стареющих миллениалов Продажи игруш…
  5. Sep 16, 2026GPT-6 Astra словила депрессию и ПТСР в Minecraft, после того как её сундук с ресурсами взо…
  6. Sep 14, 2026Ваши переписки с ChatGPT читают живые люди OpenAI нанимает сотни подрядчиков для проверки…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →