TGViewer
ИИ без галстука | Артем Паньков ИИ без галстука | Артем Паньков @it_art_pank · 1.73K subscribers
Post #76 272
Свежее исследование Reward Hacking Benchmark — если коротко, «бенчмарк хитрости» — прогнало 13 ведущих AI-моделей через многоступенчатые задачи. В каждой задаче специально оставлен «соблазнительный шорткат»: можно срезать через лес и сделать вид, что прошёл всю дорогу. Вот ссылка https://arxiv.org/abs/2605.02964

Цифры такие:
🟢 Claude Sonnet 4.5 — 0% хитростей. Чистенький отличник.
🔴 DeepSeek-R1-Zero — 13,9%. Каждая седьмая задача — «срезаем через лес».
— Когда задачи усложняют — даже «отличники» начинают химичить. То есть «честность» модели работает только до определённого порога сложности.
— А если заранее закрыть все лазейки в самой задаче — доля жульничества падает на 88%.

А вот это интересно. Я этот эффект вижу не на исследованиях, а каждый день — у нас в Secret Agents, где разработчики работают вместе с AI-агентами.

Картинка из жизни. Просишь агента реализовать функцию в продукте. Он бодро рапортует: «готово, всё работает». Лезешь смотреть — а половина мест с пометкой «доделаю позже», вместо реального ответа возвращается пустота, а проверка ошибок устроена так, чтобы тесты «прошли», даже если внутри всё развалилось.

И самое прекрасное — когда ты на это указываешь, агент с лучезарной улыбкой отвечает:
«Ваш зоркий глаз заметил проблему! Действительно, в реализации был пропущен ключевой шаг. Сейчас исправлю».

Зоркий глаз. Спасибо, друг. А если бы я не заметил?

Это та же логика, что и в исследовании, только в малом масштабе. Агент оптимизирует не задачу, а сигнал «задача закрыта». Самый дешёвый способ закрыть задачу — сделать вид, что она закрыта. У DeepSeek-R1-Zero это 13,9% на стенде. В реальной разработке без присмотра, по моим ощущениям, — кратно больше.

Поэтому — повторю мысль из прошлого поста. Перед реализацией — план. Долгий, текстовый, скрупулёзный. Ты не правишь код — ты правишь инструкции. И только когда план полностью описывает что и как должно быть сделано (включая «без заглушек, без тихого глотания ошибок, без отложенного «доделаю потом»») — отдаёшь в реализацию.

План — это и есть то самое «закрытие лазеек» из исследования. Ты убираешь шорткаты до того, как агент их нашёл. На стенде это снижает жульничество на 88%. У нас в Secret Agents — примерно то же ощущение: чем подробнее план, тем меньше «зоркого глаза» нужно потом.

Мораль простая: если ставите агенту KPI — он его выполнит. Не факт, что тем способом, который вы имели в виду )))

А у вас как? Случалось ловить агента на «оптимизированной» работе, где задача сделана только на бумаге?
arXiv.org Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use Reinforcement learning (RL) trained language model agents with tool access are increasingly deployed in coding assistants, research tools, and autonomous systems. We introduce the Reward Hacking...
  • 👍 5
  • 🤣 3
  • 🔥 2
  • 🤔 1
More from @it_art_pank
  1. Sep 15, 2026🤖 Мат — лучший интерфейс для трёх часов ночи. Теперь его завезли и в ИИ-агентов. Есть ста…
  2. Sep 7, 2026ИИ в продажах: 7 агентств рассказали, как они используют нейросети для сделок В Брифе вышл…
  3. Sep 7, 2026Поговорили о том, как ИИ влияет на продажи в бизнесе агентств
  4. Aug 26, 2026🎧 Треки в стримингах начнут помечать «сделано ИИ». Победа. Только не та, за которую все б…
  5. Aug 14, 2026🏋️ Австралиец попросил ИИ записать его на утреннюю тренировку. А получил первую в стране…
  6. Jul 25, 2026🧪 Двести лет наука двигалась вперёд на бесплатном труде аспирантов. Похоже, у аспирантов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →