TGViewer
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение @dsproglib · 18.3K subscribers
Post #7574 1.61K
Оценка качества LLM — шпаргалка по метрикам и методам

Как понять что модель работает хорошо? Единой метрики нет — зависит от задачи.

📊 Автоматические метрики

🔤 Для генерации текста:

· BLEU — совпадение n-грамм с эталоном. Быстро, но плохо коррелирует с качеством

· ROUGE — полнота n-грамм. Чаще используется для суммаризации

· BERTScore — семантическое сходство через эмбеддинги. Лучше BLEU/ROUGE

· METEOR — учитывает синонимы и морфологию. Лучше для перевода


📐 Для RAG и QA:

· Faithfulness — насколько ответ соответствует контексту (не галлюцинирует)

· Answer Relevance — насколько ответ релевантен вопросу

· Context Recall — насколько полно использован контекст

· Context Precision — насколько точно выбраны релевантные куски

Инструменты: RAGAS, TruLens

🤖 LLM-as-Judge

Используете сильную модель (GPT-4, Claude) чтобы оценить ответ слабой.

Самый гибкий метод:
Оцени ответ по шкале 1-5:
· Точность (фактическая корректность)
· Полнота (покрытие вопроса)
· Релевантность (соответствие запросу)
· Стиль (читаемость и тон)

· Плюсы: гибко, понимает нюансы
· Минусы: дорого, bias к похожим на себя ответам, не детерминировано

👥 Human evaluation

· Попарное сравнение (A vs B) — надёжнее абсолютных оценок

· Оценка по чеклисту критериев

· Crowdsourcing через Toloka, MTurk

Золотой стандарт, но дорого и медленно.

🏆 Бенчмарки

· MMLU — знания по 57 областям

· HumanEval / EvalPlus — генерация кода

· MT-Bench — многоходовые диалоги

· HELM — комплексная оценка по многим задачам

· LiveBench — обновляется, минимизирует data contamination

Когда что использовать

· Разработка → автоматические метрики + LLM-as-Judge (быстро и дёшево)

· До продакшена → human evaluation на репрезентативном сете

· В продакшене → мониторинг через LLM-Judge + сбор user feedback

· Для публикации/сравнения → стандартные бенчмарки

📍 Навигация: ВакансииЗадачиСобесы

Библиотека дата-сайентиста

#буст
  • 👍 6
  • ❤ 1
More from @dsproglib
  1. Sep 20, 2026Что выведет код? 👍 — {} 👾 — {«x»: 1} 🥰 — Error 🔥 — None 🐸 Библиотека задач по Data Sc…
  2. Sep 19, 2026🌞 3 open-source инструмента для AI-агентов 🔘 Agent-Reach — доступ к Twitter/X, YouTube,…
  3. Sep 18, 2026А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tp…
  4. Sep 18, 2026📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
  5. Sep 17, 2026🤗 Fine-tuning LLM в Google Colab — без собственной GPU Unsloth Studio позволяет попробова…
  6. Sep 15, 2026🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представи…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →