Когда мы тестируем ИИ агента, важно проверять не только, как он рассуждает, какие шаги делает или какие инструменты вызывает,
а выполнил ли он задачу до конца. Именно это и измеряет показатель Task Success Rate (TSR).
По сути, TSR - это доля задач, в которых ИИ агент успешно достиг цели в не зависимости от того, как он это выполнил.
Например:
ИИ агент должен оформить заказ - оформил
ИИ агент должен найти документ — нашел
ИИ агент должен объяснить запрос пользователю,дал корректный ответ
И если хотя бы один из шагов при выполнении задачи провален и агент не достиг нужного результата, то задача считается проваленной.
Метрика в целом кажется простой, но именно она показывает итоговую картину качества работы ИИ агента.
Можно иметь идеальный reasoning, правильные вызовы тулов и подробный лог действий, но если цель не достигнута, то это уже не имеет значение.
TSR чаще всего не рассматривают изолированно, поэтому можно снимать дополнительные показатели, такие как :
Average Steps per Success, сколько шагов ИИ агент делает для выполнения задачи.
Error Recovery Rate, насколько часто ИИ агент сам исправляет ошибки без внешнего вмешательства.
Partial Success Rate, доля задач, где ИИ агент частично достиг цели (например, собрал данные, но не выполнил действие).
В целом, если говорить о TSR, то данная метрика по факту отвечает на ключевой вопрос, справился ли агент с задачей, да или нет, что является одним из самых важный критериев проверки работы ИИ агента.
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #68
669

- 👍 7
- 🔥 4