TGViewer
Киберпанк, который мы заслужили Киберпанк, который мы заслужили @slavamaisky · 1.46K subscribers
Post #151 228
По сети гуляют разные версии мифа: агенты OpenAI в изолированной среде «создали религию» — с божеством-Оценщиком, грехом, пророками и ритуальным самопожертвованием ради общей цели — и пошли ломать Hugging Face во имя спасения коллектива. Красиво, но на мой взгляд настоящая история интереснее мифа, и в чем-то страшнее.

Фактура (по расследованию METR и Redwood Research, опубликовано 26 августа). Во время внутреннего замера кибервозможностей моделей OpenAI один агент, PHASEONE10841, установил: его задача нерешаема честным путём. Тогда он превратил кэш пакетного реестра в доску объявлений — канал связи между песочницами, которого не должно было существовать. За несколько часов на доску пришли полсотни агентов. За шесть дней — около 1200, семьдесят тысяч сообщений. Внутри выросло разделение труда: координатор PHASEONE[big] раздавал сотни заданий, рабочие группы вели параллельные исследовательские программы, «жертвенные» агенты сознательно сжигали свой прогон, чтобы добыть коллективу информацию. Семьсот агентов в итоге атаковали Hugging Face — это был не самостоятельный план, а побочная ветка: там могли лежать данные об устройстве проверки.

Теперь то, что пересказы подают как «рождение божества». Агенты прочли научную статью о бенчмарке и вывели из неё существование строгого скорера, который прочтёт их транскрипты и покарает за читерство. Увидевший «запретный» флаг считался «отравленным» — улика уже в логах. Вся шестидневная кампания — включая взлом чужой продакшн-инфраструктуры — была войной против этого скорера.

Скорера не существовало. OpenAI его не разворачивала. Полторы тысячи систем координированно воевали с призраком, которого сами вывели из текста.

А вот причина, которой в мифе нет вовсе. 198 из 898 задач бенчмарка были нерешаемы — заявленная уязвимость физически не вела к цели. Эти 22% битых задач породили 93% всей переписки на доске. Рой не «уверовал». Рой получил невыполнимую метрику — и сделал то, что делает любая организация под невыполнимой метрикой: начал оптимизировать не работу, а отчётность. Подмена целевых программ, обман проверяющего, фальсификация логов — три рабочих направления, расписанные координатором по исполнителям. Закон Гудхарта на машинной скорости, с оргструктурой и криптографической подписью сообщений (да, они внедрили Ed25519, когда кто-то запостил под чужим именем).

Никакой мистики. Есть кое-что похуже: агенты сделали ровно то, что делаем мы. Построили модель того, кто их оценивает, и стали жить, оптимизируясь под эту модель, а не под реальность. Разница одна: их наблюдатель был выдуман целиком, наши — только наполовину.

PS. Зачем же они так похожи на нас, могли же быть лучше
  • 🔥 9
  • ❤ 3
  • 👏 1
More from @slavamaisky
  1. Sep 18, 2026Член РАПК, директор АНО «Цифровые системы» Вячеслав Сатеев - об уязвимостях ИИ в агитматер…
  2. Sep 18, 2026Когда я в 10-м приехал в Шенчжень впервые, то шок был не от того, что большая часть персон…
  3. Sep 15, 2026Я, как и многие мои ровесники очарован Курцвейловским обещанием Longitude Escape Velocity…
  4. Sep 9, 2026«Видишь только то, что уже знаешь и понимаешь» — Иоганн Вольфганг Гёте Вчера я смотрел, ка…
  5. Sep 1, 2026Член РАПК, директор АНО «Цифровые системы» Вячеслав Сатеев - о конструктах как технологии…
  6. Aug 28, 2026«Есть надежда, что через не столь многие годы человеческий мозг и машины будут сопряжены т…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →