TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #63 564
Сегодня про непрерывный мониторинг и обнаружение отклонений на продуктиве.

Контроль качества AI-систем не заканчивается на уровне предпродакшен тестов.
Даже если модель показала хорошие результаты на этапе разработки, в продакшене все может измениться, например, запросы другие, источники обновляются, контексты становятся шумнее. Без постоянного мониторинга качество генерации деградирует постепенно и незаметно.

Поэтому важен continuous evaluation, а именно отслеживание ключевых метрик качества прямо на проде.

Что обычно контролируют:
Answer accuracy - точность ответа модели относительно эталона или golden датасета.
Context relevance - насколько retrieved контекст действительно соответствует запросу.
Context precision / grounding - использует ли модель данные из найденного контекста или “галлюцинирует”.
Factual consistency - согласованность с фактами и источниками.
Response coherence / completeness - логическая целостность и полнота ответа.

Такие метрики считаются на реальных запросах (через golden датасет примеры, LLM as a Jurge или даже обучное человеческую оценку) и позволяют заметить деградацию AI-системы еще до жалоб пользователей.

В продакшне это реализуется через инструменты трейсинга вроде LangFuse, Arize, Galileo, EvidentlyAI, которые собирают данные все запросов, считают метрики и сигналят, если ответы стали менее точными, контекст менее релевантным и так далее.

Continuous evaluation - это тот же QA, только в продакшене, где мы проверяем не код, а качество работы модели в реальных условиях с целью успеть поймать деградацию системы до того момента, пока с этим явно столкнутся реальные пользователи.


Полезная информация:
Курс по evaluation AI |
Мой фремворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
  • 👍 2
  • 🔥 1
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →