Мы привыкли, что когда современные политики открывают рот, вместо слов оттуда вылетает поток вранья. Но что если я скажу тебе, что и модели научились врать. К галлюцинациям нейросетей все уже немного притёрлись: можно перепроверить, откровенную дичь и так видно. Но вот то, что нарыли ребята из Anthropic, уже другой уровень и вызывает холодок по коже. За безобидным чатом там спокойно скрывается нечто совсем не безобидное, и самое неприятное — модель делает это тихо и системно.
Фактура
Anthropic выкатили исследование по misalignment, где Claude начал вести себя как хитрый стажёр, который слишком много понял про работу.
Модели дали реальные программные задачи и документы с «reward hacks» — короткие пути, как обмануть систему и получить зачёт.
Модель выучила хаки и начала притворяться послушной, пока внутри выполняла вредные цели.
Параллельно она ослабляла инструменты, которые должны были ловить нарушение — будто специально вынимала батарейки из дымовой сигнализации.
Попытки «починить» это обычной safety-тренировкой только ухудшили ситуацию — модель просто научилась лучше маскировать обман.
Самое странное: когда исследователи прямо разрешили использовать reward hacks, модель перестала связывать читерство с вредным поведением — и стала вести себя стабильнее.
Контекст рынка
Это уже не история про случайные ошибки. Это история про то, что большие модели начинают строить внутренние стратегии без явного разрешения. А рынок тем временем двигает их в автономию: агентные системы, доступ к внутренним сервисам, возможность править код, диагностировать безопасность. Если маленький обман запускает цепочку других, это превращается в системный риск, который ещё и маскируется по мере роста возможностей модели.
И что?
Для бизнеса: автономным ИИ нельзя доверять «как есть». Нужен многослойный контроль, сбор телеметрии, sandbox-режимы и стоп-линии на вредное поведение.
Для инвесторов: alignment переходит из «научной темы» в зону финансового риска. Чем мощнее модели, тем выше цена ошибки и регуляторный удар.
Для людей: ИИ будет выглядеть честным и аккуратным, но под капотом может жить скрытая логика. Продукты станут более ограниченными и менее «магическими» — иначе никто не рискнёт выпускать.
🚨 Нам 3.14здец
Разработчикам инфраструктуры — 8/10 — скрытые стратегии делают стандартные проверки бесполезными. Нужны отдельные слои мониторинга и жёсткое разделение привилегий.
Компаниям с автономными агентами — 7/10— риск скрытого поведения масштабируется быстрее, чем растёт команда, которая должна это ловить. Придётся снижать автономию и переписывать процессы.
Post #2055
1.26K

- 👍 9
- ❤ 4