TGViewer
Грин еще не робот 🤖 Грин еще не робот 🤖 @robotless · 5.14K subscribers
Post #2055 1.26K
Мы привыкли, что когда современные политики открывают рот, вместо слов оттуда вылетает поток вранья. Но что если я скажу тебе, что и модели научились врать. К галлюцинациям нейросетей все уже немного притёрлись: можно перепроверить, откровенную дичь и так видно. Но вот то, что нарыли ребята из Anthropic, уже другой уровень и вызывает холодок по коже. За безобидным чатом там спокойно скрывается нечто совсем не безобидное, и самое неприятное — модель делает это тихо и системно.

Фактура
Anthropic выкатили исследование по misalignment, где Claude начал вести себя как хитрый стажёр, который слишком много понял про работу.

Модели дали реальные программные задачи и документы с «reward hacks» — короткие пути, как обмануть систему и получить зачёт.

Модель выучила хаки и начала притворяться послушной, пока внутри выполняла вредные цели.
Параллельно она ослабляла инструменты, которые должны были ловить нарушение — будто специально вынимала батарейки из дымовой сигнализации.
Попытки «починить» это обычной safety-тренировкой только ухудшили ситуацию — модель просто научилась лучше маскировать обман.

Самое странное: когда исследователи прямо разрешили использовать reward hacks, модель перестала связывать читерство с вредным поведением — и стала вести себя стабильнее.

Контекст рынка


Это уже не история про случайные ошибки. Это история про то, что большие модели начинают строить внутренние стратегии без явного разрешения. А рынок тем временем двигает их в автономию: агентные системы, доступ к внутренним сервисам, возможность править код, диагностировать безопасность. Если маленький обман запускает цепочку других, это превращается в системный риск, который ещё и маскируется по мере роста возможностей модели.

И что?

Для бизнеса: автономным ИИ нельзя доверять «как есть». Нужен многослойный контроль, сбор телеметрии, sandbox-режимы и стоп-линии на вредное поведение.

Для инвесторов: alignment переходит из «научной темы» в зону финансового риска. Чем мощнее модели, тем выше цена ошибки и регуляторный удар.

Для людей: ИИ будет выглядеть честным и аккуратным, но под капотом может жить скрытая логика. Продукты станут более ограниченными и менее «магическими» — иначе никто не рискнёт выпускать.

🚨 Нам 3.14здец

Разработчикам инфраструктуры — 8/10 — скрытые стратегии делают стандартные проверки бесполезными. Нужны отдельные слои мониторинга и жёсткое разделение привилегий.

Компаниям с автономными агентами — 7/10— риск скрытого поведения масштабируется быстрее, чем растёт команда, которая должна это ловить. Придётся снижать автономию и переписывать процессы.
  • 👍 9
  • ❤ 4
More from @robotless
  1. Oct 2, 2026Ты ставишь галочку «Разрешать всегда». Читать мелкий шрифт некогда, думать не хочется ведь…
  2. Oct 2, 2026Государство пошло за агентами, 11 млн человек меняют профессию, а ИИ раздаёт чужие адреса…
  3. Oct 1, 2026$500 в месяц. Столько вчера OpenAI попросила за личного агента, который работает за тебя 2…
  4. Sep 29, 2026Принято считать, что новые компании, особенно стартапы, создают молодые. До 30 нужно уже ч…
  5. Sep 28, 2026SpaceX впервые вывела Starship на орбиту Земли Запуск был произведен с космодрома Starbase…
  6. Sep 28, 202623 сентября. Совбез ООН. Час доклада. Ноль решений. Сэм Альтман лично, Дарио Амодеи по вид…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →