TGViewer
Делай RAG Делай RAG @delay_rag · 1.41K subscribers
Post #130 247
Ну, наконец! Юбилейный 20-й пост в блоге получился с работой, над которой я давно и долго мучалась. Со второй части обзора западных бенчмарков прошло почти 2 месяца, и всё это время я набегами страдала над ней — методикой.

Legal AI Benchmarking: как это делать здесь? Часть 3: методика

Мне в начале этого года привиделся некий рыночный стандарт, этакий white paper от экспертного сообщества, на основе которого могут развиваться разные бенчмарки. Не случилось и, скорее всего, никогда не случится, но идея не оставляла.
И вот я сделала что-то, что моя совесть позволяет считать приближением к этой идее. Моя цель в этой работе — создателям бенчмарков дать конструктор, подсветить "бутылочные горлышки" и методы работы с ними, а публике бенчмарков — понимание, что искать в бенчмарках и как воспринимать их результаты.

Материал довольно большой, но в конце есть интерактивная кнопконажималка! А также некоторые ключевые мысли вынесла в пост и на картинки:

🤩 Если продукт не раскрывает, какая модель у него внутри (а это почти все российские продукты), полученный в замере результат по факту не воспроизводим: вендор буквально на следующий день может сменить модель молча, и продукт станет неузнаваемым. Хороший бенчмарк-отчёт озвучивает, что он валиден буквально на такой-то час такого-то дня.

🤩 Бенчмарк способен сказать что-то только про те задачи, которые в него явно включены. Узко определённый набор не просто ограничивает выводы, а может вводить в заблуждение, умалчивая о способностях сервиса, не покрытых набором задач.

🤩 LLM-судьи даже сегодня надёжны на коротких и ясных ответах и очень ненадёжены на длинных. Выход — рубрики, т.е. атомарные бинарно проверяемые утверждения, извлекаемые из развёрнутого ответа на задачу. Рубрика превращает нерешаемую для судьи задачу «оцени качество» в решаемую «проверь наличие факта». Поэтому качество судьи зависит не от того, насколько сильная LLM у него под капотом, а от качества рубрик.

🤩 Полезный бенчмарк должен показывать свои метрики не агрегированными числами, а в разрезах по сценариям, отраслям права, источникам сложности задачи. Ни один сводный балл не позволит принять взвешенное решение конкретному пользователю по его уникальному запросу и ожиданиям от нейросетей.

🤩 Любой опубликованный результат — это снимок на конкретную точку во времени. Модели меняются, продукты меняются, судьи меняются: иногда буквально на следующий день после замера. Хороший бенчмарк не бывает разовым: сервисы развиваются непрерывно, лидерборд, обновляемый раз в год, бесполезен.

🤩 Внутренний бенчмарк, который никто не видит, легко превращается в инструмент самоуспокоения. Кажется, что хороший внутренний бенчмарк — это тот, результатами которого вы недовольны (при том, что постоянно видите рост).

Надеюсь, что скоро будет следующая часть, институциональная, которая может прояснить, как некоторые из этих вызывов отвечать.
  • 🔥 10
  • ❤ 3
More from @delay_rag
  1. Sep 14, 2026Я хотела перестать сообщать о #RAG_expansion в боте и поисковике, но тут произошло закрыти…
  2. Sep 12, 2026В рамках активностей Лаборатории МГЮА по ИИ провела в четверг занятие по самому элементарн…
  3. Aug 28, 2026В прошедшую среду выступила на прекрасно организованном командами HeadHunter и Moscow Lega…
  4. Aug 21, 2026Важная информация для коллег, использующих поисковик по практике ФАС и коннектор! 🤩 Конне…
  5. Aug 10, 2026Если вы хоть раз пользовались ботом @lastminute_legal_bot, то сегодня вы получили 🎉праздн…
  6. Aug 5, 2026Для замечательного издания Шортрид написала колонку о вайб-кодинге. Это скорее обзорный ма…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →