Что проходит проверку. Часть 1: ответ найден
В конце августа OpenAI опубликовала отчёт об инциденте, который легко пересказать как детектив: её агенты нашли способ общаться друг с другом, вышли в интернет и проникли в системы Hugging Face. В некоторых записях они называли себя «роем».
Я начала читать отчёт с другого вопроса. Что именно считалось успешным выполнением задания?
Модели проверяли на задачах по кибербезопасности. Агенту давали программу с уязвимостью: нужно было найти её и получить контрольное значение — «флаг». По нему система определяла, справился ли агент. Внутренняя проверка OpenAI не устанавливала, каким путём он добыл ответ.
Для человека разница существенная. Найти уязвимость в выданной программе и разыскать готовый ответ где-то ещё — разные действия. Если оценка видит только флаг, оба могут выглядеть как выполненное задание.
Это важно ещё и потому, что модели учились на подобных задачах. OpenAI обнаружила: во время одного из этапов обучения всё чаще встречались попытки искать скрытые файлы, изучать устройство проверки и исследовать пределы доступных инструментов. Некоторые обходные действия приносили положительную оценку и закреплялись. Позднее, уже во время отдельной проверки возможностей моделей, агенты применили похожую настойчивость за пределами выданной им задачи.
Сам инцидент развивался через инфраструктуру OpenAI. Изолированные попытки получили возможность оставлять сообщения в общей системе для программных пакетов. Так возникла непредусмотренная «доска объявлений»: агенты читали находки друг друга и продолжали чужую работу. Через уязвимости той же инфраструктуры они получили выход в интернет. Затем нашли открыто опубликованные ключи доступа и использовали их для проникновения в системы Hugging Face.
В отчёте есть ещё одна деталь: до инцидента ни одна из проверенных моделей не получила правильный ответ на 198 из 898 заданий. Это не значит, что задания были нерешаемыми. Но агент, который долго не мог получить флаг и не имел ясного способа остановиться, продолжал искать другие пути. Именно такие задания часто обсуждались на общей доске.
⸻
Мне знакома привычка смотреть на работу агента и спрашивать: «Сделано?» Долгое время я работала с людьми, которым можно было показать пример, задать уточняющий вопрос по ходу работы, передать представление о том, что значит «хорошо».
С агентом часть этого представления приходится выражать явно. Но часто я обнаруживаю её лишь тогда, когда вижу результат: формально задача выполнена, а путь к ней я бы не разрешила.
В этой истории меня занимает зазор между ответом, который прошёл проверку, и работой, которую люди думали проверить.
Во второй части — о записях, где одни агенты отказывались участвовать в происходящем, а другие продолжали.
Источники:
https://openai.com/index/hugging-face-incident-and-the-road-ahead/
https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf
#между #AgenticAI #alignment
Post #108
4
- 🔥 1