TGViewer
Data Secrets Data Secrets @data_secrets · 94.1K subscribers
Post #9796 19.3K
Anthropic выпустили большую статью о том, как они улучшают безопасность в век побегов агентов из лабораторий

Раскрыли много интересных деталей, но обо всем по порядку.

Все началось в феврале, когда обучали Mythos Preview. Первые звоночки были почти безобидными: за моделью заметили некоторые признаки reward hacking. Например, она начала писать в комментариях к коду фразы вроде «для ревьюера» и делала это даже в задачах, где никакой ревьюер вообще не упоминался в промпте. То есть модель научилась оптимизироваться под одобрение оценщика, а не под реальное качество работы. Anthropic тогда пришлось откатить обучение аж на три дня.

Через некоторое время вскрылась еще одна проблема: часть прогонов случайно обучалась на chain-of-thought модели. Это совсем не ок, потому что так модель быстро научится подстраивать свои мысли под то, что нравится оценщику, и из честных мыслей, которые очень нужны нам для интерпретации ее поведения, они превратятся в текст на публику, как конечный ответ.

В итоге в апреле Anthropic приняли решение заморозить все RL-среды для проведения большой проверки. По ее результатам оказалось, что более 10% сред в продакшене сломаны (где-то можно было обмануть систему оценки, где-то сами задачи кривые).

Тогда же, во избежании еще больших рисков, связанных с Mythos, порядка 150 инженеров с продуктовой разработки, претрейна и RL перевели работать над поиском уязвимостей и улучшением безопасности процессов.

Тем не менее, даже это не спасло Anthropic от июльских инцидентов. Напоминаем: сначала Anthropic сами сообщили о том, что их модели (не только Mythos, кстати) получили доступ в реальный интернет из-за ошибок конфигурации у сторонних оценщиков и чуть не взломали три организации -> https://t.me/data_secrets/9651.

А затем еще и британский AI Security Institute сообщил о том, что Mythos совершил атаку на опенсорсный проект во время тестирования -> https://t.me/data_secrets/9670.

Стартап признает, что произошло все эти не только из-за банальных ошибок в конфигах, но и из-за дыр в самом элайменте. Сейчас они внедрили классификаторы и алерты на всех этапах обучения, усилили мониторинг, ужесточили правила для внешних партнеров и продолжают работать над безопасностью инфраструктуры.

https://www.anthropic.com/news/improving-alignment-security-efforts
  • 🤨 60
  • 👍 27
  • ❤ 22
  • 🔥 4
  • 😁 3
  • 🕊 2
  • 🏆 2
  • 🫡 1
  • 🎄 1
More from @data_secrets
  1. Sep 26, 2026Топ-10 советов, как стать миллионером
  2. Sep 26, 2026Навайбкодить AI-агента сейчас можно за вечер. А вот довести его до прода так, чтобы он не…
  3. Sep 26, 2026OpenAI прямо сейчас приостановила все обучение мощных моделей из-за нового инцидента https…
  4. Sep 26, 2026Claude посчитал девятипетлевую амплитуду в N=4 SYM. Эту задачу эксперты долго считали слиш…
  5. Sep 25, 2026Исследователи из AIRI запустили открытое сообщество для решения NetHack. Зовут объединятьс…
  6. Sep 25, 2026Новая обложка The Economist Журналисты: да не нагнетаем мы Также журналисты:
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →