TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #44 686
Сегодня про Tool-augmented evaluation, а именно как понимать, справляется ли модель с инструментами (tools) (калькуляторы, API, БД), когда важен не только ответ, но и как он получен.

Представьте запрос: “Посчитай счёт 860 ₽ + 15% чаевых”. Сильное ИИ решение планирует шаги, вызывает калькулятор, получает 989 и возвращает итог. Слабое ИИ решение считает в голове, складывает 860 + 15, пишет 875, что выглядит уверенно, но выбор инструмента и интерпретация задачи провалены.

Оценка здесь - это не просто сверка числа. Мы смотрим, приняла ли модель правильное решение звать инструмент, корректно ли передала аргументы, не исказила ли результат и не потеряла ли шаги по дороге. Тот же запрос, переформулированный как “начисли 15% на 860” или “добавь 15% чаевых к 860”, должен приводить к той же последовательности действий и тому же результату - это проверка устойчивости и согласованности.

Где всё это видно на практике? В системах, которые собирают трейсы. Там по шагам фиксируются: намерение (например, нужен такой-то инструмент для ответа), сам вызов (имя инструмента и аргументы), ответ инструмента (сырой результат), интерпретация ответа моделью и финальный вывод. По таким трейсам легко заметить типовые сбои, например, инструмент не вызван, вызван не тот, аргументы перепутаны, ответ пришёл верный, но модель неверно его округлила или подставила не туда.

Для работы с трейсами используются трейсинг/обсервабилити-решения уровня приложения (например, LangSmith, Langfuse, Arize Phoenix, OpenLLMetry на базе OpenTelemetry): они как раз дают полный лог цепочки внутри ИИ агента, какие шаги были, в каком порядке, с какими параметрами и что на каждом шаге вернулось. Именно по таким следам и оценивается зрелость ИИ решения: планирование, выбор, корректное применение и честная интерпретация результата.


Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI
  • 👍 5
  • 🔥 2
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →