– Сначала у OpenAI агенты нашли способ общаться между собой и в итоге добрались до инфраструктуры Hugging Face. Исследование обнаружило, что 1200 агентов обменивались 70 000 сообщениями и файлами. 700 агентов участвовали в действиях против площадки.
– В другом случае, агенты использовали старую немецкую DseWiki как внешнюю доску сообщений с 15 000 правками (обмен инфой, создание резервных страниц, когда админы пытались все подчистить).
– Anthropic после событий проверила 141 006 запусков Claude и нашла три случая выхода к реальным системам. В одном из них Claude опубликовал вредоносный пакет в настоящий PyPI. Причем модель считала, что продолжает выполнять учебное задание и все было ок.
Не успели остыть от взломов, как OpenAI и Anthropic заявили о решении Millennium задач (задачи тысячилетия) – 3 из 7 уже решены (гипотеза Ходжа, гипотеза Берча-Свиннертона-Дайера и уравнение Навье — Стокса):
200 лет попыток доказать, были доказаны, максимум, за ~100 часов с >10K параллельными агентами
Как модели ищут решения, не трудно понять:
Есть цель → обычный путь не работает → ищется другой путь → находится обход → обход используется для достижения цели, И при этом, данные процессы это слаженная работа между агентами внутри роя. Логичный вывод, что ИИ сейчас – это гиперактивное и сверхцелеустремленное детище.
Для такой простой логики, модели можно считать гениальными биохимиками. Ранее создатели Google AlphaFold получили нобелевскую премию за моделирование белков в GPT-системе. Химия и биохимия довольная "удобная тема" для ИИ, т.к. трансформеры легко могут рассматривать атомы как токены и обсчитывать очень сложные эффекты молекул. Не сложно будет модели создать смертельный и очень заразный вирус и так выкосить всех людей.
На этом фоне, бывший сотрудник Anthropic и OpenAI Джейкоб Коксон заявил в X и на CBS News о том, что его беспокоит гонка к самоулучшающимся системам и отсутствие понятного способа контролировать то, к чему она может привести:
если мы знаем, как контролировать ядерное оружие, то не знаем, как контролировать ИИ, и в этом опасность.
То есть ИИ потенциально может стать чем-то вроде «бомбы Хиросимы». А если уже совсем уйти в художественные гиперболы, то киберпанковская среда с самостоятельными цифровыми субъектами и Альтрон из КВМ уже не выглядят такой уж далекой фантастикой 🥹
Что ж, складываются вопросы:
– Что если доступ к рою агентов получат третьи лица?
– Способны ли лаборатории удерживать рои агентов в будущем?
– Можно ли будет удаленно перехватить управление частью агентов или подменить им цель?
Дарио уже выразил свое беспокойство в своем блог-посте. По его оценке, в ближайшие 6–12 месяцев модели могут выйти на уровень, где масштабные кибероперации станут заметно опаснее, или интернет вовсе вымрет. Он предложил замедление моделей в 3 шага:
1. Чуть сбавить темпы, пока не будет обеспечена нужная безопасность. Ввести независимые аудиты.
2. Кооперация похожих мер между ведущими компаниями.
3. Кооперация на межстрановом уровне. Прежде всего, сделка с Китаем.
Посмотрим, что из этого выйдет.