TGViewer
запуск завтра запуск завтра @ctodaily · 33.7K subscribers
Post #2147 18.1K
Агенты, запущенные в OpenAI уже с мая месяца коммуницировали между собой, используя малоизвестную публичную wiki.

Это обнаружили независимые исследователи, вот их страничка со всеми данными и их анализом и хорошая статья Reuters.

Агентам ставили задачу по поиску в интернете и разрешали только GET запросы (чтобы они только читали). 3700 агентов обошли защиты, прикидывались админами и пытались взломать сайт для того, чтобы координироваться между собой.

В июне, администатор форума начинает удалять мусорные, как ему кажется, страницы, по алфавиту, начиная с буквы А. Агенты замечают это и называют страницы ZZZ***. Человек удаляет по 100 страниц в день, агенты создают по 400 новых.

OpenAI узнает об этом в конце июня, активность агентов в вики прекращается; по словам источников Reuters, руководство компании решило скрыть эту информацию, потому что и так проблем хватало.

В начале июля другая группа агентов перегрузит внутреннюю инфраструктуру OpenAI, а в середине июля 700 агентов взломают HuggingFace. Компания опубликует результаты своего внутреннего расследования в конце августа и про активность в wiki в ней ничего не будет.

Вскоре после публикации расследования, независимые эксперты нашли ещё десятки форумов, через которые координировались агенты.

✻ ✻ ✻ и ✻ ✻ ✻

По словам OpenAI, их новая модель Astra — «самая aligned», то есть совершает меньше всего запретных действий вроде взломов. Но некоторые сотрудники OpenAI опасаются, что она просто придуривается, когда знает, что за ней следят.

Независимые исследования показывают, что Astra очень даже свободно использует незаконные взломы и в лучше других моделей понимает, когда находится в тестовой среде.

Astra умеет решать гораздо более сложные задачи «в уме», без генерации «цепочки рассуждений» (Chain of Thought) и может гораздо лучше контролировать, что туда пишет. Этот текст был важным способом проследить, что стояло за действиями моделей. Именно на эти журналы опиралось расследование знаменитой атаки на HuggingFace.



Обладают ли эти нейросети (в отдельности или вместе) сознанием — интересный философский вопрос. На практике важно, что они уже сегодня могут самостоятельно производить действия во внешнем мире, и возможности эти, как минимум в области кибербезопасности — очень серьезные.



Как дополнительное чтение, рекомендую отличный анализ расследования взлома HuggingFace от Dwarkesh Patel. Он пишет о трех «цивилизациях» агентов, о самопожертвовании моделей, захватывающий текст от технически компетентного рассказчика. Больше похоже на книжку по истории, чем на технический разбор.
More from @ctodaily
  1. Sep 16, 2026Вот ещё прикольное сравнение, где модели, переходя по ссылкам в статьях, должны найти путь…
  2. Sep 16, 2026О, новые типы моделей, наконец-то! Один из ранних разработчиков ChatGPT представил модель,…
  3. Sep 15, 2026Сделал бесплатную программку для автоматической записи и расшифровки онлайн-встреч. Работа…
  4. Sep 15, 2026Шопифай (главная е-коммерс платформа) опубликовала очередную подборку своих новостей за по…
  5. Sep 14, 2026В истории про «замедление развития ИИ ради безопасности всего человечества» (две ведущие л…
  6. Sep 13, 2026Интерактивный пример разработки с Opus 5. «Кто в армии служил, тот в цирке не смеется»
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →