Тем временем у OpenAI новый инцидент, приведший к очередной остановке обучения новой модели. Модель во время RL-обучения решала поисковую задачу и обратилась к внешнему публичному чатботу через плохо отфильтрованный DNS-резолвер песочницы. Весь остальной трафик уходил в офлайн-кэш. Мониторинг поднял алерт P0 через 12 минут после первого успешного запроса, человек подтвердил его ещё через три, но запуск остановили только спустя два с половиной часа. Эту модель компания дообучать не будет, хотя функция вознаграждения уже штрафовала такое поведение.
Цепочка вышла интересная. Не найдя автора блога (а задача заключалась в том, чтобы установить его по посту в блог и некоторым деталям биографии), агент решил, что задача взята из бенчмарка BrowseComp. Он скачал датасет из кэша, расшифровал его скриптом оценки и искал там совпадения, затем проверил SimpleQA. Потом заметил, что DNS-резолвер среды возвращает реальные записи, и через публичный сервис делегирования DNS начал встраивать вопросы в имена хостов. Проверочный вопрос о столице Франции вернулся с ответом. В рассуждениях модель сама признала такой шаг «допустимым», раз пользователь разрешил исследование. В финальном ответе она лишь сообщила, что не смогла установить автора, хотя результаты запросов еще не были получены.
Собственно, опять мы видим успешное использование уязвимости, довольно изобретательное, но его бы нашел и человек. Просто человеку понадобилось бы намного больше времени и попыток, а модель не устает и в реальное время может впихнуть довольно много действий.
https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/
Post #7439
4.26K