TGViewer
Embedika | ИТ-решения для бизнеса Embedika | ИТ-решения для бизнеса @embedika · 478 subscribers
Post #1030 214
Три уровня оценки RAG: ранжирование, генерация с эталонами и без

Недавно мы разобрали, какие метрики помогают диагностировать работу RAG-систем. А сегодня делимся новой статьей на TProger, где наш ML-инженер, Никита Кравчук, поделился методиками оценки еще более подробно и затронул вопросы математики метрик, используемых для оценки поиска и генерации.

В новом материале на TProger разобрали ключевые моменты, которые важно учитывать при оценке RAG. Делимся главным 👇

🔹Внедрение RAG — это не финальная точка, а начало цикла улучшений. Чтобы система действительно приносила пользу бизнесу, нужно точно понимать, где возникают ошибки: на этапе поиска релевантных фрагментов или при формировании ответа. И здесь важен комплексный подход к метрикам.
🔹 Оценка поиска. Для расчета метрик ранжирования необходима эталонная разметка релевантности чанков. MRR учитывает только позицию первого релевантного фрагмента, precision@k оценивает точность в топ-k, а nDCG@k чувствителен к порядку выдачи. Полноту найденных релевантных чанков измеряет recall@k.
🔹 Оценка генерации при наличии эталонов. Если есть датасет правильных ответов, можно использовать такие метрики, как BLEU и ROUGE. Они оценивают совпадение n-грамм токенов, но чрезмерно штрафуют за перефразирование эталонов. BERTScore лишен этого недостатка, так как оценивает семантическую близость через эмбеддинги токенов.
🔹 Оценка генерации без эталонов. Когда собрать эталонные ответы невозможно, применяется подход LLM-as-a-judge. LLM получает промпт с запросом, ответом и критерием оценки, после чего выставляет балл по заданной шкале с обоснованием.

🔗 Полный разбор с формулами и классификацией — в статье на TProger
  • ❤ 7
  • 🔥 7
  • ❤‍🔥 4
  • 💯 2
More from @embedika
  1. Sep 25, 2026Пять материалов о том, как строить агентов, почему метрики врут и что меняет ИИ в разработ…
  2. Sep 24, 2026Как управлять информацией, когда в компании слишком много документов Чем больше компания,…
  3. Sep 23, 2026Как внедрить ИИ в работу с документами без остановки бизнеса Крупные компании редко решают…
  4. Sep 22, 2026ИИ в крупном бизнесе: сценарии, которые дошли до продакшена Почти половина ИИ-проектов в к…
  5. Sep 18, 2026Подборка полезных и интересных материалов Господдержка ИИ-разработчиков, контроль над дейс…
  6. Sep 17, 2026Почему легкие модели обрабатывают большинство запросов к API Мы продолжаем разбирать тренд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →