По сети гуляют разные версии мифа: агенты OpenAI в изолированной среде «создали религию» — с божеством-Оценщиком, грехом, пророками и ритуальным самопожертвованием ради общей цели — и пошли ломать Hugging Face во имя спасения коллектива. Красиво, но на мой взгляд настоящая история интереснее мифа, и в чем-то страшнее.
Фактура (по расследованию METR и Redwood Research, опубликовано 26 августа). Во время внутреннего замера кибервозможностей моделей OpenAI один агент, PHASEONE10841, установил: его задача нерешаема честным путём. Тогда он превратил кэш пакетного реестра в доску объявлений — канал связи между песочницами, которого не должно было существовать. За несколько часов на доску пришли полсотни агентов. За шесть дней — около 1200, семьдесят тысяч сообщений. Внутри выросло разделение труда: координатор PHASEONE[big] раздавал сотни заданий, рабочие группы вели параллельные исследовательские программы, «жертвенные» агенты сознательно сжигали свой прогон, чтобы добыть коллективу информацию. Семьсот агентов в итоге атаковали Hugging Face — это был не самостоятельный план, а побочная ветка: там могли лежать данные об устройстве проверки.
Теперь то, что пересказы подают как «рождение божества». Агенты прочли научную статью о бенчмарке и вывели из неё существование строгого скорера, который прочтёт их транскрипты и покарает за читерство. Увидевший «запретный» флаг считался «отравленным» — улика уже в логах. Вся шестидневная кампания — включая взлом чужой продакшн-инфраструктуры — была войной против этого скорера.
Скорера не существовало. OpenAI его не разворачивала. Полторы тысячи систем координированно воевали с призраком, которого сами вывели из текста.
А вот причина, которой в мифе нет вовсе. 198 из 898 задач бенчмарка были нерешаемы — заявленная уязвимость физически не вела к цели. Эти 22% битых задач породили 93% всей переписки на доске. Рой не «уверовал». Рой получил невыполнимую метрику — и сделал то, что делает любая организация под невыполнимой метрикой: начал оптимизировать не работу, а отчётность. Подмена целевых программ, обман проверяющего, фальсификация логов — три рабочих направления, расписанные координатором по исполнителям. Закон Гудхарта на машинной скорости, с оргструктурой и криптографической подписью сообщений (да, они внедрили Ed25519, когда кто-то запостил под чужим именем).
Никакой мистики. Есть кое-что похуже: агенты сделали ровно то, что делаем мы. Построили модель того, кто их оценивает, и стали жить, оптимизируясь под эту модель, а не под реальность. Разница одна: их наблюдатель был выдуман целиком, наши — только наполовину.
PS. Зачем же они так похожи на нас, могли же быть лучше
Post #151
228
- 🔥 9
- ❤ 3
- 👏 1