TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #7 1.38K
Всем привет!

Сегодня разберем конкретные инструменты для оценки и анализа GenAI-приложений.

Сразу скажу: с генеративным ИИ все сложнее, чем с классическим машинным обучением. Здесь нет четких правильных ответов, а оценка часто субъективна и зависит от контекста.

Специализированные фреймворки для GenAI

DeepEval — один из самых популярных опенсорсных фреймворков для evaluation LLM-приложений. Поддерживает много готовых метрик: faithfulness (оценка галлюцинаций), answer relevancy (релевантность ответов), contextual precision и recall для RAG-систем. Данный фреймворк позволяет автоматизировать процесс оценки, так как используем другую LLM для оценки метрик.

LangSmith от LangChain — отличная платформа (бесплатна с ограничением по количеству трейсов) для отладки и мониторинга LLM-приложений. Позволяет трейсить все вызовы внутри AI-based приложения, от входного промпта до финального ответа пользователю. Очень удобно для понимания, где именно ломается ваша RAG-система. Альтернатива - бесплатная локальная версия Langfuse.

Ragas — опенсорс фреймворк, который специально заточен под RAG-приложения. Оценивает качество retrieval, generation и end-to-end performance. Из коробки поддерживает метрики типа answer relevancy, context precision, context recall, faithfulness.

Evidently AI — опенсорсный фреймворк для evaluation и мониторинга GenAI-систем. Предоставляет готовые метрики для оценки качества LLM-ответов: correctness, coherence, fluency, relevance. Особенно силен в evaluation RAG-систем — умеет оценивать как качество retrieval, так и generation.

Я советую начинать с DeepEval или Ragas — они проще в настройке и имеют хорошую документацию.

Важно помнить, что оценка GenAI — это итеративный процесс. Метрики нужно постоянно калибровать под вашу конкретную задачу AI-based приложения.


Полезная информация:
С чего начать изучение AI
  • 👍 12
  • 🔥 6
  • ❤ 1
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →