Ну, наконец! Юбилейный 20-й пост в блоге получился с работой, над которой я давно и долго мучалась. Со второй части обзора западных бенчмарков прошло почти 2 месяца, и всё это время я набегами страдала над ней — методикой.
Legal AI Benchmarking: как это делать здесь? Часть 3: методика
Мне в начале этого года привиделся некий рыночный стандарт, этакий white paper от экспертного сообщества, на основе которого могут развиваться разные бенчмарки. Не случилось и, скорее всего, никогда не случится, но идея не оставляла.
И вот я сделала что-то, что моя совесть позволяет считать приближением к этой идее. Моя цель в этой работе — создателям бенчмарков дать конструктор, подсветить "бутылочные горлышки" и методы работы с ними, а публике бенчмарков — понимание, что искать в бенчмарках и как воспринимать их результаты.
Материал довольно большой, но в конце есть интерактивная кнопконажималка! А также некоторые ключевые мысли вынесла в пост и на картинки:
🤩 Если продукт не раскрывает, какая модель у него внутри (а это почти все российские продукты), полученный в замере результат по факту не воспроизводим: вендор буквально на следующий день может сменить модель молча, и продукт станет неузнаваемым. Хороший бенчмарк-отчёт озвучивает, что он валиден буквально на такой-то час такого-то дня.
🤩 Бенчмарк способен сказать что-то только про те задачи, которые в него явно включены. Узко определённый набор не просто ограничивает выводы, а может вводить в заблуждение, умалчивая о способностях сервиса, не покрытых набором задач.
🤩 LLM-судьи даже сегодня надёжны на коротких и ясных ответах и очень ненадёжены на длинных. Выход — рубрики, т.е. атомарные бинарно проверяемые утверждения, извлекаемые из развёрнутого ответа на задачу. Рубрика превращает нерешаемую для судьи задачу «оцени качество» в решаемую «проверь наличие факта». Поэтому качество судьи зависит не от того, насколько сильная LLM у него под капотом, а от качества рубрик.
🤩 Полезный бенчмарк должен показывать свои метрики не агрегированными числами, а в разрезах по сценариям, отраслям права, источникам сложности задачи. Ни один сводный балл не позволит принять взвешенное решение конкретному пользователю по его уникальному запросу и ожиданиям от нейросетей.
🤩 Любой опубликованный результат — это снимок на конкретную точку во времени. Модели меняются, продукты меняются, судьи меняются: иногда буквально на следующий день после замера. Хороший бенчмарк не бывает разовым: сервисы развиваются непрерывно, лидерборд, обновляемый раз в год, бесполезен.
🤩 Внутренний бенчмарк, который никто не видит, легко превращается в инструмент самоуспокоения. Кажется, что хороший внутренний бенчмарк — это тот, результатами которого вы недовольны (при том, что постоянно видите рост).
Надеюсь, что скоро будет следующая часть, институциональная, которая может прояснить, как некоторые из этих вызывов отвечать.
Post #130
247


- 🔥 10
- ❤ 3