TGViewer
Draft AI | Иван Кундиль Draft AI | Иван Кундиль @draft_ai_law · 335 subscribers
Post #62 655
Апелляция на собственный бенчмарк: как я искусственно раздул метрики реранкера

Недавно я публиковал бенчмарк эмбеддинг-моделей для юридического RAG и делал в нём крайне убедительные выводы: про реранкер, про эмбеддинги, про гибриды. Как оказалось, часть этих выводов была неверной.

На эту мысль меня подтолкнула Екатерина, отдельное ей спасибо. В методике моего расчета была брешь, которую я не заметил.

Что переделал: разметил 2751 пару (вместо 635) на уровне сырой выдачи, до этапа реранкинга, добавил к тесту еще одну локальную модель - deepvk/USER2-base. Вопросов по-прежнему 30. Что получилось:

〰️Реранкер не даёт значимого прироста. Разница между выдачей "до" и "после" реранкера на моих данных в пределах погрешности, а для некоторых моделей эффект даже отрицательный (видно в таблице). То есть фактически прироста нет. Оговорка: вывод касается только конкретного реранкера, который у меня установлен. С другим реранкером результат может быть совсем иной.

〰️Вывод про гибрид двух эмбеддингов устоял, но стал скромнее. Эффект от объединения двух моделей на честной разметке уменьшился, но остался. Оговорка: это сработает только если найти «нормальный» реранкер, который хорошо сортирует результаты. Без него гибрид расширяет корзину кандидатов, но до пользователя нужные дела всё равно могут не дойти. А существует ли "нормальный" реранкер - я пока не знаю.

〰️ О рейтинге эмбеддингов. На старой разметке все модели после реранкера были статистически неотличимы. К тесту я добавил ещё одну модель, которую часто рекомендуют в юридическом сообществе нейросетей, — deepvk/USER2-base. Значения и рейтинг в таблице к посту. Из рейтинга выделяется топ-3, но в рамках теста разница между этими тремя моделями считается погрешностью (30 вопросов — это небольшая выборка для уверенных выводов). Так что на этой выборке их результаты можно считать равными.

Главная находка - USER2-base. Локальная русская модель от deepvk, бесплатная, при этом по качеству не уступает OpenAI ($2.84 за индексацию моего корпуса) и Voyage ($0.63). Без API, без санкционных рисков.

Полная версия поста с таблицами и детальным разбором.
  • 👍 8
  • 🔥 7
More from @draft_ai_law
  1. Jul 12, 2026Как большие лимиты могут лишать нас опыта Последние несколько месяцев я довольно экономно…
  2. Jul 9, 2026Тест 14 нейросетей: всегда ли нужна топовая модель? Мой сервис по каждому судебному делу с…
  3. Jul 2, 2026На ПМЮФ-2026 прошла сессия «Юрист будущего: портрет профессии в эпоху искусственного интел…
  4. Jun 26, 2026Как использовать нейросети для поиска судебной практики: запись вебинара 24 июня мы провел…
  5. Jun 22, 2026А у нас новый вебинар! Пожалуй с самым холиварным вопросом для юристов) Как использовать н…
  6. Jun 15, 2026Собрал юридический плагин для Claude Code и сравнил результаты При подготовке документа с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →