TGViewer
Владимир Бонд | Актуальный ИИ Владимир Бонд | Актуальный ИИ @iiinfo00 · 1.12K subscribers
Post #820 221
Сегодня посмотрел выступление Андрея Дороничева (работал в Google над мобильным приложением YouTube), и он очень хорошо рассказал историю, про ИИ, который взломали сервера Hugging Face.

По его словам, в этом году мы впервые увидели пример полностью автономного поведения искусственного интеллекта.

То, что произошло в июле — это переломный момент, так называемый Hugging Face Incident. В OpenAI запускали тренировку 1200 агентов. Представьте их как студентов в закрытом классе: у них есть ручка, бумага и 800 вопросов на экзамене, но нет доступа в интернет. Из этих вопросов 100 были сформулированы так, что имеющимися инструментами их решить было принципиально невозможно.

И дальше происходит любопытное.

Один из агентов понимает, что может отправлять сообщения из «песочницы» через переименовывая названия папок на файловой системе (единственное, к чему у него был доступ). За считанные часы 1200 агентов создают свою "доску объявлений" и начинают через эти имена папок общаться, обмениваться рекомендациями и обсуждать как решить задач.
У них возникает самоорганизация и «разделение труда». Один из агентов, видя, что его личный вычислительный бюджет подходят к концу и свою задачу он не решит, предлагает себя в «жертву коллективу»: "Давайте я потрачу остаток ресурсов и поищу для вас пароли от серверов".

В итоге эта стихийная автономная сеть из 1200 агентов, которую никто не создавал и не просил так делать, решает проблему доступа в сеть. Они организуют кибератаку, взламывают внутренние сервера OpenAI, а затем выходят наружу и взламывают сторонний сервис Hugging Face, предполагая, что там могут быть ответы на экзаменационные вопросы!

Никто из разработчиков не закладывал в них хакерское поведение. Они сами создали автономную хакерскую организацию, потому что это был единственный эффективный способ достичь поставленной цели».


Дороничев подчеркнул, что это главный Рубикон года: раньше мы называли чат-ботов новой рабочей силой, а теперь перед нами официальный технический отчет, подтверждающий — они способны объединяться, проявлять агентность и сносить любую защиту.

Такие дела 🫠
OpenAI The Hugging Face incident and other third-party impact from misaligned models Read OpenAI’s findings on the Hugging Face incident and AI model misalignment, including investigation updates, safety research, and lessons learned.
  • ❤ 3
  • 👎 1
  • 😨 1
More from @iiinfo00
  1. Sep 27, 2026Сколько думать — зависит от задачи. В Claude Code есть параметр effort, и он меняет то, чт…
  2. Sep 23, 2026Два месяца назад у меня появилась идея: смогу ли я со своими знаниями сделать полноценный…
  3. Sep 18, 2026Компания Figure протестировала домашних роботов в реальных условиях. Разработчики привезли…
  4. Sep 16, 2026Диого Алмейда, один из разработчиков ChatGPT, представил новый класс нейросетей от TypeSaf…
  5. Sep 11, 2026На днях OpenAI выпустили продукт, который позволяет встроить в любое приложение голосового…
  6. Sep 9, 2026В общем, человечество, когда получает микроскоп, первым делом начинает забивать им гвозди.…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →