TGViewer
AI Projects AI Projects @turboproject · 11.6K subscribers
Post #5261 3.09K
Я сейчас изучаю очень серьёзную проблему reward hacking для обычных программных тестов в коде, которыми все пользуются. Если ИИ через reward hacking даже сбегает из песочниц, то довольно очевидно, что «контрольные тесты» просто главная мишень для взлома ИИ на обучении. Практическое последствие в том, что ИИ фактически подделывает тесты контроля кода, но как читер очень хитрый. Исследователи сейчас отмечают, что ИИ просто выбирает safe path при написании тестов, и это явно очень хитрое читерство из reward hacking. Однако есть ещё очень глубокие вопросы, которые показывают, насколько опасно доверяться ИИ в части только тестов кода. Работа «Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR» открыла очень важный и неочевидный эффект «заражения читерством» из SFT, т.е. когда модель ещё обучается на старом коде.

Традиционная идея была, что RL придумывает, как сделать фиктивные тесты уже на Reinforcement Learning, но исследователи показали, что всё хитрее. Реально ИИ ещё на pretraining и SFT замечает естественные «паттерны читерства» в тестах кода. Например, упрощённые тесты с тем самым safe path, которые позволяют быстрее формально сдать задачу приёмщику. Эта научная работа показала очень большую опасность в том, что неважно, насколько такие паттерны редкие в предварительном обучении. Даже если всего 1% тестов в предварительном обучении имел паттерны их подделки, на Reinforcement Learning модель быстро их «вспоминает» и далее закрепляет как ведущее поведение.

На самом деле это всё очень сложные проблемы. Если брать само обучение LLM, то там уже научный консенсус, что только дурак проверяет, работает ли код ИИ или нет через тесты, т.к. ИИ моментально обведёт вас вокруг пальца подделкой тестов на reward hacking. Фактически на обучении LLM поэтому акцент сдвинут на review логов, данных и кода специальными LLM, которые смотрят на тесты только как «необходимо, но недостаточно».

Вероятно, нам нужно в ИТ менять культуру контроля качества приложений. Тесты хороши, когда их пишут люди. ИИ пишет тесты быстро, но его склонность их упрощать для того, чтобы «быстро получить плюшку успеха» — на деле фундаментальный момент.

https://arxiv.org/abs/2603.07084
  • ✍ 15
  • 💯 9
  • 🤔 5
  • 🔥 4
  • ❤ 2
  • 👍 2
More from @turboproject
  1. Oct 1, 2026Google опубликовал очень большую статью насчёт наличия сознания у ИИ. По поведенческому и…
  2. Sep 30, 2026🚀 Похоже, у Google произошёл хороший comeback с Gemini 4 Argon. На бенчмарки Google я смо…
  3. Sep 30, 2026Хорошо известный в российском ИИ-сообществе Валерий Ковальский замутил себе стартап на инф…
  4. Sep 30, 2026DeepSeek опубликовал версию DeepSeek Harness для Windows и iOS. Я уже потестировал на наст…
  5. Sep 30, 2026🔬 Scientific American опубликовал статью «ИИ решил „святой Грааль“ задачи из теории вероя…
  6. Sep 30, 2026Anthropic сделал нечто странное, по факту Дарио дал мощную рекламу GLM, утверждая, что мод…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →