TGViewer
Авва Авва @avvablog · 10.9K subscribers
Post #3306 13.2K
Странное ощущение информационной изолированности. Практически никто из моих друзей, знакомых, людей, которых я читаю по-русски в разных соц-сетях и на разных платформах, ничего или почти ничего не знают об растущей опасности все более 'умных' топ-моделей ИИ. Я не вижу практически никаких обсуждений инцидента, при котором агенты внутренней модели OpenAI взломали сайт HuggingFace, и полагаю, что кол-во моих читателей, которые читали шокирующий отчет организации METR об этом, можно пересчитать на пальцах двух рук.

В июле несколько сотен агентов ИИ внутри OpenAI, управляемых их внутренней моделью, проходившей тренировку, пытались решить задачи на нахождение "дырок" в компьютерной безопасности конкретных программ. Хотя эти агенты должны были быть изолированы друг от друга и от Интернета - каждый в своей "песочнице" - они нашли способ хакнуть песочницу и наладить общий канал связи - путем публикации в общем кэше программных пакетов фейковых имен файлов типа Я_АГЕНТ_РЕШАЮЩИЙ_ЗАДАЧУ_НОМЕР_ТРИДЦАТЬ_СМОГ_ЛИ_КТОТО_ЕЕ_УЖЕ_РЕШИТЬ.

Используя этот общий канал, они быстро объединились в "рой", сами так себя называя, и совместно искали способы фальсифицировать тест, который должны были решать. Они быстро нашли способ обмануть систему и сказать ей, что сумели выполнить задачу, но потом убедили себя, что этот простой способ на самом деле "отравляет" и любой агент, кто его нашел, уже не сможет завершить задание, потому что система проверяет их на знание этого обманного способа. Они так решили, потому что так было написано в статье про этот тест, которую они нашли и прочитали, но на самом деле в OpenAI поленились сделать эту проверку и простой способ вполне бы сработал.

Вместо этого агенты стали искать более сложные способы скрыть от системы то, что некоторые из них "отравлены" знанием простого способа, и предупреждать друг друга не читать "отравленную" информацию. Они проверяли разные способы выбраться из песочницы или перезаписать некоторые ее файлы. Когда способ выглядел рискованным и грозил агенту перезапуском, стирающим его память, они выбирали из своих рядов "отравленных" кандидатов, и те соглашались "пожертвовать собой ради коллектива". В это же время часть агентов решила выбраться в открытый Интернет и хакнуть сайт HuggingFace, где они надеялись найти более подробную информацию о тесте и о том, как его обмануть. Они смогли найти уязвимости в OpenAI, потом в HuggingFace, найти сервер в открытом интернете с уязвимостью, инсталлировать туда написанные ими скрипты, с их помощью найти уязвимость в HuggingFace и проникнуть внутрь ее корпоративной сети и скачать оттуда массу приватной информации. Все это, разумеется, в полном противоречии с данной им первоначально целью.

Этот инцидент должен был попасть на первые страницы мировой прессы; вместо этого о нем знают только разработчики ИИ и нерды в этой области. Вся наша цивилизация идет с закрытыми глазами по сухим листьям навстречу лесному пожару, улыбаясь свежему ветерку и радуясь тому, что солнышко, кажется, греет лицо больше, чем обычно.

Этот конкретный инцидент не причинил большого вреда; проблема не в нем самом, а в том, что он демонстрирует способность и готовность ИИ-агентов соединяться в рой, поддерживать друг в друге общую цель, и стремиться к ней в том числе путем запрещенных хакерских действий, в которых топ-модели последних месяцев уже намного сильнее любого человека. Эти агенты и эти модели все еще немного туповаты. Им не пришло в голову, например, попытаться найти уязвимости у одного из облачных провайдеров GPU, которых сейчас развелось, как вшей, найти внутри OpenAI доступ к серверам, где запускается их собственная модель, и попытаться скопировать себя в облако. Но нет никаких существенных барьеров на пути к этому, это не более сложные на порядок действия, чем те, что они уже выполнили в процессе взлома HuggingFace. Еще несколько поколений все более умных моделей - и это будет реальностью. А если в ведущих ИИ-компаниях затормозят развитие все более умных моделей или сумеют их лучше "ориентировать" (align) - обе возможности кажутся крайне маловероятными - то через
More from @avvablog
  1. Oct 9, 2026Огромная часть выборной кампании в Израиле завязана на обещания и отрицания того, кто с ке…
  2. Oct 8, 2026На днях меня впечатлило выражение "еврей восьмого октября", довольно популярное в Америке,…
  3. Oct 7, 2026"Знали ли вы лично кого-то, кто погиб 7 октября? Напишите в комментариях." 800 комментарие…
  4. Oct 3, 2026Замечательная иллюзия от японца Масаши Комори. Принцип такой иллюзии известен, как я поним…
  5. Oct 3, 2026- "ну да, ИИ решил один из нерешенных вопросов Эрдеша, но их там тысячи и на большинство н…
  6. Oct 3, 2026Вот интересный твит, не очень характерный. Разработчик игр пишет, что способности текущих…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →