TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #30 801
Всем привет!

Сегодня разберем реранкинг, технику, которая может улучшить качество RAG-систем. Именно он часто решает проблему "нашли много, но не то".

Реранкинг - это двухэтапный процесс поиска данных. Сначала система находит большое количество потенциально релевантных документов (обычно 50-100) с помощью быстрого, но не очень точного метода. Затем более сложная модель переранжирует эти результаты, оставляя только самые релевантные (5-10 документов).

Представьте: вы ищете "настройка безопасности веб-сервера". Первичный поиск может вернуть 50 документов обо всем, что связано с серверами и безопасностью. Реранкер анализирует каждый документ детальнее и выбирает только те, которые действительно про настройку безопасности именно веб-серверов.

Типы реранкинга:

Cross-encoder реранкинг использует модели типа BERT, которые обрабатывают запрос и документ совместно. Качество высокое, но медленно — нужно обработать каждую пару запрос-документ отдельно.
Bi-encoder + Cross-encoder pipeline - сначала быстрый bi-encoder находит кандидатов, потом медленный cross-encoder их переранжирует. Компромисс между скоростью и качеством.
LLM-based реранкинг использует большие языковые модели для оценки релевантности. Модель получает запрос и документ, возвращает score от 0 до 1.

Метрики для evaluation реранкинга:

Precision@K: сколько из топ-K результатов действительно релевантны.
NDCG: учитывает не только релевантность, но и позицию в рейтинге.
MRR (Mean Reciprocal Rank): на какой позиции в среднем находится первый релевантный результат.


Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI
  • 🔥 4
  • 👍 2
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →