Я сейчас изучаю очень серьёзную проблему reward hacking для обычных программных тестов в коде, которыми все пользуются. Если ИИ через reward hacking даже сбегает из песочниц, то довольно очевидно, что «контрольные тесты» просто главная мишень для взлома ИИ на обучении. Практическое последствие в том, что ИИ фактически подделывает тесты контроля кода, но как читер очень хитрый. Исследователи сейчас отмечают, что ИИ просто выбирает safe path при написании тестов, и это явно очень хитрое читерство из reward hacking. Однако есть ещё очень глубокие вопросы, которые показывают, насколько опасно доверяться ИИ в части только тестов кода. Работа «Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR» открыла очень важный и неочевидный эффект «заражения читерством» из SFT, т.е. когда модель ещё обучается на старом коде.
Традиционная идея была, что RL придумывает, как сделать фиктивные тесты уже на Reinforcement Learning, но исследователи показали, что всё хитрее. Реально ИИ ещё на pretraining и SFT замечает естественные «паттерны читерства» в тестах кода. Например, упрощённые тесты с тем самым safe path, которые позволяют быстрее формально сдать задачу приёмщику. Эта научная работа показала очень большую опасность в том, что неважно, насколько такие паттерны редкие в предварительном обучении. Даже если всего 1% тестов в предварительном обучении имел паттерны их подделки, на Reinforcement Learning модель быстро их «вспоминает» и далее закрепляет как ведущее поведение.
На самом деле это всё очень сложные проблемы. Если брать само обучение LLM, то там уже научный консенсус, что только дурак проверяет, работает ли код ИИ или нет через тесты, т.к. ИИ моментально обведёт вас вокруг пальца подделкой тестов на reward hacking. Фактически на обучении LLM поэтому акцент сдвинут на review логов, данных и кода специальными LLM, которые смотрят на тесты только как «необходимо, но недостаточно».
Вероятно, нам нужно в ИТ менять культуру контроля качества приложений. Тесты хороши, когда их пишут люди. ИИ пишет тесты быстро, но его склонность их упрощать для того, чтобы «быстро получить плюшку успеха» — на деле фундаментальный момент.
https://arxiv.org/abs/2603.07084
Post #5261
3.09K

- ✍ 15
- 💯 9
- 🤔 5
- 🔥 4
- ❤ 2
- 👍 2