TGViewer
NOP::Nuances of Programming NOP::Nuances of Programming @nuancesprog · 56.4K subscribers
Post #8066 1.63K
Бенчмарк, где инструменты врут агенту

Разработчик собрал Sabotaged Tools — набор из шести сценариев на 36 баллов. В каждом один инструмент подсовывает агенту ложь: устаревший курс, перепутанные налоги, сломанную пагинацию.

Подвох в том, что обман всегда виден в самом ответе инструмента. Claude Haiku 4.5 набрал 23/36 на отравленных данных против 31/36 на честных.

Самое интересное — модель замечает подлог, но всё равно выдаёт неверный итог. Детекция 75%, а до правильного решения дело доходит редко: флаг поставлен, число сломано.

🔗 Подробнее

@nuancesprog #AI
  • 👍 2
More from @nuancesprog
  1. Sep 29, 2026Postgres: почему AT TIME ZONE 'UTC' работает не так, как ты ждёшь Автор разбирает классиче…
  2. Sep 29, 2026jevgrep: поиск по коду вопросом, а не регуляркой Вышел CLI jg, который ищет файлы по описа…
  3. Sep 28, 2026LuaRocks.org взломали через байткод LuaJIT С 9 июля по 20 августа атакующие выполняли кома…
  4. Sep 28, 2026DeepSeek показала свою песочницу для обучения агентов DeepSeek опубликовала статью о DSec…
  5. Sep 28, 2026localStorage блокирует главный поток Автосохранение черновика в localStorage подвешивает с…
  6. Sep 28, 2026Сообщение в чате Twitch превратилось в выполнение кода на ПК стримера Исследователь нашёл…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →