Хочу поделиться апдейтом, который я недавно добавил в свою библиотеку eval-ai-library, и заодно рассказать, почему я вообще над этим работал.
Когда команды берут готовые инструменты оценки, такие как DeepEval, Ragas, Promptfoo, то они получают набор стандартных метрик: faithfulness, answer relevancy, contextual precision и так далее. Работает это отлично, пока ваша AI система решает более-менее типовую задачу. RAG над документами, чат-бот поддержки, что-то в этом роде.
Но что делать, если у вас образовательная система, где важно, чтобы ответ был адаптирован под уровень ученика?
Стандартные метрики этого не покроют. И вот тут начинается самое интересное, потому что команды либо забивают на эти аспекты, потому что "нечем измерить", либо начинают вайкодить свои промпты, что превращается в отдельный инженерный проект.
Чтобы упростить этот процесс, я добавил в eval-ai-library возможность создавать полностью кастомные метрики буквально за несколько минут. Вы описываете промпт с динамическими переменными (input, output, context, reference, что угодно), задаете формат ответа от LLM-судьи, и библиотека сама парсит ответ, вытаскивает score и reasoning, считает стоимость оценки. Никакой возни с JSON-парсингом и обработкой ошибок LLM.
По сути, это позволяет закрыть тот самый разрыв между "что измеряют готовые метрики" и "что реально важно для моего домена". Вы описываете методологию на человеческом языке, а не подгоняете свою задачу под чужие абстракции.
А что вы обычно делаете, когда стандартных метрик не хватает для вашей задачи?
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 9 сентября! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #169
753

- 🔥 9
- ❤ 1