Оценка качества LLM — шпаргалка по метрикам и методамКак понять что модель работает хорошо? Единой метрики нет — зависит от задачи.
📊
Автоматические метрики🔤 Для генерации текста:
· BLEU — совпадение n-грамм с эталоном. Быстро, но плохо коррелирует с качеством
· ROUGE — полнота n-грамм. Чаще используется для суммаризации
· BERTScore — семантическое сходство через эмбеддинги. Лучше BLEU/ROUGE
· METEOR — учитывает синонимы и морфологию. Лучше для перевода
📐 Для RAG и QA:
· Faithfulness — насколько ответ соответствует контексту (не галлюцинирует)
· Answer Relevance — насколько ответ релевантен вопросу
· Context Recall — насколько полно использован контекст
· Context Precision — насколько точно выбраны релевантные куски
Инструменты: RAGAS, TruLens
🤖
LLM-as-JudgeИспользуете сильную модель (GPT-4, Claude) чтобы оценить ответ слабой.
Самый гибкий метод:
Оцени ответ по шкале 1-5:
· Точность (фактическая корректность)
· Полнота (покрытие вопроса)
· Релевантность (соответствие запросу)
· Стиль (читаемость и тон)
· Плюсы: гибко, понимает нюансы
· Минусы: дорого, bias к похожим на себя ответам, не детерминировано
👥
Human evaluation· Попарное сравнение (A vs B) — надёжнее абсолютных оценок
· Оценка по чеклисту критериев
· Crowdsourcing через Toloka, MTurk
Золотой стандарт, но дорого и медленно.
🏆
Бенчмарки· MMLU — знания по 57 областям
· HumanEval / EvalPlus — генерация кода
· MT-Bench — многоходовые диалоги
· HELM — комплексная оценка по многим задачам
· LiveBench — обновляется, минимизирует data contamination
✅
Когда что использовать· Разработка → автоматические метрики + LLM-as-Judge (быстро и дёшево)
· До продакшена → human evaluation на репрезентативном сете
· В продакшене → мониторинг через LLM-Judge + сбор user feedback
· Для публикации/сравнения → стандартные бенчмарки
📍 Навигация:
Вакансии •
Задачи •
СобесыБиблиотека дата-сайентиста #буст