Бенчмарк, где инструменты врут агенту
Разработчик собрал Sabotaged Tools — набор из шести сценариев на 36 баллов. В каждом один инструмент подсовывает агенту ложь: устаревший курс, перепутанные налоги, сломанную пагинацию.
Подвох в том, что обман всегда виден в самом ответе инструмента. Claude Haiku 4.5 набрал 23/36 на отравленных данных против 31/36 на честных.
Самое интересное — модель замечает подлог, но всё равно выдаёт неверный итог. Детекция 75%, а до правильного решения дело доходит редко: флаг поставлен, число сломано.
🔗 Подробнее
@nuancesprog #AI
Post #8066
1.63K

- 👍 2