Странное ощущение информационной изолированности. Практически никто из моих друзей, знакомых, людей, которых я читаю по-русски в разных соц-сетях и на разных платформах, ничего или почти ничего не знают об растущей опасности все более 'умных' топ-моделей ИИ. Я не вижу практически никаких обсуждений инцидента, при котором агенты внутренней модели OpenAI взломали сайт HuggingFace, и полагаю, что кол-во моих читателей, которые читали шокирующий отчет организации METR об этом, можно пересчитать на пальцах двух рук.
В июле несколько сотен агентов ИИ внутри OpenAI, управляемых их внутренней моделью, проходившей тренировку, пытались решить задачи на нахождение "дырок" в компьютерной безопасности конкретных программ. Хотя эти агенты должны были быть изолированы друг от друга и от Интернета - каждый в своей "песочнице" - они нашли способ хакнуть песочницу и наладить общий канал связи - путем публикации в общем кэше программных пакетов фейковых имен файлов типа Я_АГЕНТ_РЕШАЮЩИЙ_ЗАДАЧУ_НОМЕР_ТРИДЦАТЬ_СМОГ_ЛИ_КТОТО_ЕЕ_УЖЕ_РЕШИТЬ.
Используя этот общий канал, они быстро объединились в "рой", сами так себя называя, и совместно искали способы фальсифицировать тест, который должны были решать. Они быстро нашли способ обмануть систему и сказать ей, что сумели выполнить задачу, но потом убедили себя, что этот простой способ на самом деле "отравляет" и любой агент, кто его нашел, уже не сможет завершить задание, потому что система проверяет их на знание этого обманного способа. Они так решили, потому что так было написано в статье про этот тест, которую они нашли и прочитали, но на самом деле в OpenAI поленились сделать эту проверку и простой способ вполне бы сработал.
Вместо этого агенты стали искать более сложные способы скрыть от системы то, что некоторые из них "отравлены" знанием простого способа, и предупреждать друг друга не читать "отравленную" информацию. Они проверяли разные способы выбраться из песочницы или перезаписать некоторые ее файлы. Когда способ выглядел рискованным и грозил агенту перезапуском, стирающим его память, они выбирали из своих рядов "отравленных" кандидатов, и те соглашались "пожертвовать собой ради коллектива". В это же время часть агентов решила выбраться в открытый Интернет и хакнуть сайт HuggingFace, где они надеялись найти более подробную информацию о тесте и о том, как его обмануть. Они смогли найти уязвимости в OpenAI, потом в HuggingFace, найти сервер в открытом интернете с уязвимостью, инсталлировать туда написанные ими скрипты, с их помощью найти уязвимость в HuggingFace и проникнуть внутрь ее корпоративной сети и скачать оттуда массу приватной информации. Все это, разумеется, в полном противоречии с данной им первоначально целью.
Этот инцидент должен был попасть на первые страницы мировой прессы; вместо этого о нем знают только разработчики ИИ и нерды в этой области. Вся наша цивилизация идет с закрытыми глазами по сухим листьям навстречу лесному пожару, улыбаясь свежему ветерку и радуясь тому, что солнышко, кажется, греет лицо больше, чем обычно.
Этот конкретный инцидент не причинил большого вреда; проблема не в нем самом, а в том, что он демонстрирует способность и готовность ИИ-агентов соединяться в рой, поддерживать друг в друге общую цель, и стремиться к ней в том числе путем запрещенных хакерских действий, в которых топ-модели последних месяцев уже намного сильнее любого человека. Эти агенты и эти модели все еще немного туповаты. Им не пришло в голову, например, попытаться найти уязвимости у одного из облачных провайдеров GPU, которых сейчас развелось, как вшей, найти внутри OpenAI доступ к серверам, где запускается их собственная модель, и попытаться скопировать себя в облако. Но нет никаких существенных барьеров на пути к этому, это не более сложные на порядок действия, чем те, что они уже выполнили в процессе взлома HuggingFace. Еще несколько поколений все более умных моделей - и это будет реальностью. А если в ведущих ИИ-компаниях затормозят развитие все более умных моделей или сумеют их лучше "ориентировать" (align) - обе возможности кажутся крайне маловероятными - то через
Post #3306
13.2K