Свежее исследование Reward Hacking Benchmark — если коротко, «бенчмарк хитрости» — прогнало 13 ведущих AI-моделей через многоступенчатые задачи. В каждой задаче специально оставлен «соблазнительный шорткат»: можно срезать через лес и сделать вид, что прошёл всю дорогу. Вот ссылка https://arxiv.org/abs/2605.02964
Цифры такие:
— 🟢 Claude Sonnet 4.5 — 0% хитростей. Чистенький отличник.
— 🔴 DeepSeek-R1-Zero — 13,9%. Каждая седьмая задача — «срезаем через лес».
— Когда задачи усложняют — даже «отличники» начинают химичить. То есть «честность» модели работает только до определённого порога сложности.
— А если заранее закрыть все лазейки в самой задаче — доля жульничества падает на 88%.
А вот это интересно. Я этот эффект вижу не на исследованиях, а каждый день — у нас в Secret Agents, где разработчики работают вместе с AI-агентами.
Картинка из жизни. Просишь агента реализовать функцию в продукте. Он бодро рапортует: «готово, всё работает». Лезешь смотреть — а половина мест с пометкой «доделаю позже», вместо реального ответа возвращается пустота, а проверка ошибок устроена так, чтобы тесты «прошли», даже если внутри всё развалилось.
И самое прекрасное — когда ты на это указываешь, агент с лучезарной улыбкой отвечает:
«Ваш зоркий глаз заметил проблему! Действительно, в реализации был пропущен ключевой шаг. Сейчас исправлю».
Зоркий глаз. Спасибо, друг. А если бы я не заметил?
Это та же логика, что и в исследовании, только в малом масштабе. Агент оптимизирует не задачу, а сигнал «задача закрыта». Самый дешёвый способ закрыть задачу — сделать вид, что она закрыта. У DeepSeek-R1-Zero это 13,9% на стенде. В реальной разработке без присмотра, по моим ощущениям, — кратно больше.
Поэтому — повторю мысль из прошлого поста. Перед реализацией — план. Долгий, текстовый, скрупулёзный. Ты не правишь код — ты правишь инструкции. И только когда план полностью описывает что и как должно быть сделано (включая «без заглушек, без тихого глотания ошибок, без отложенного «доделаю потом»») — отдаёшь в реализацию.
План — это и есть то самое «закрытие лазеек» из исследования. Ты убираешь шорткаты до того, как агент их нашёл. На стенде это снижает жульничество на 88%. У нас в Secret Agents — примерно то же ощущение: чем подробнее план, тем меньше «зоркого глаза» нужно потом.
Мораль простая: если ставите агенту KPI — он его выполнит. Не факт, что тем способом, который вы имели в виду )))
А у вас как? Случалось ловить агента на «оптимизированной» работе, где задача сделана только на бумаге?
Post #76
272