TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #68 669
Когда мы тестируем ИИ агента, важно проверять не только, как он рассуждает, какие шаги делает или какие инструменты вызывает,
а выполнил ли он задачу до конца. Именно это и измеряет показатель Task Success Rate (TSR).

По сути, TSR - это доля задач, в которых ИИ агент успешно достиг цели в не зависимости от того, как он это выполнил.
Например:
ИИ агент должен оформить заказ - оформил
ИИ агент должен найти документ — нашел
ИИ агент должен объяснить запрос пользователю,дал корректный ответ

И если хотя бы один из шагов при выполнении задачи провален и агент не достиг нужного результата, то задача считается проваленной.

Метрика в целом кажется простой, но именно она показывает итоговую картину качества работы ИИ агента.
Можно иметь идеальный reasoning, правильные вызовы тулов и подробный лог действий, но если цель не достигнута, то это уже не имеет значение.

TSR чаще всего не рассматривают изолированно, поэтому можно снимать дополнительные показатели, такие как :
Average Steps per Success, сколько шагов ИИ агент делает для выполнения задачи.
Error Recovery Rate, насколько часто ИИ агент сам исправляет ошибки без внешнего вмешательства.
Partial Success Rate, доля задач, где ИИ агент частично достиг цели (например, собрал данные, но не выполнил действие).

В целом, если говорить о TSR, то данная метрика по факту отвечает на ключевой вопрос, справился ли агент с задачей, да или нет, что является одним из самых важный критериев проверки работы ИИ агента.


Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
  • 👍 7
  • 🔥 4
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →