TGViewer
Делай RAG Делай RAG @delay_rag · 1.41K subscribers
Post #65 1.13K
Пост рефлексии о бенчмарке
(#делай_bench — полная версия на Telegraph)

На уровне эмоций есть два плана: мой личный и реакция сообщества. Мне было очень интересно этим заниматься: сюда были направлены самые сильные мои компетенции (метод-дизайн, последующая аналитика и возможность «развернуться», подробно показав изнутри весь процесс). Это по сути работа по соотнесению реальной супер-нюансированной и хаотичной юридической практики с высокоабстрактным уровнем статистики. И эта работа внезапно стала актуальной с появлением LLM и конкурирующих сервисов для юристов. Точнее эту актуализацию я для себя вижу как в каком-то смысле «идеологическую» стратегическую задачу: юристы ничем не хуже других областей знаний, где бенчмаркинг — абсолютная норма, и нужно, чтобы как можно больше использующих нейронки юристов знали о таком способе оценки качества моделей.

Про общественную реакцию — из всех моих проектов за прошедшие полгода на бенч она получилась самой бурной в стакане воды (в моих личных масштабах это действительно очень значимо). Думаю, здесь несколько причин, одна из главных — люди любят конфликты, соревнования и сравнения (думаю, это какие-то примитивные механизмы нашего мозга), даже если сравнивают вот эти вот электронные сущности без особой шоу-помпы. Второе — юридическая практика и юридическое знание очень далеки от всех этих формул, графиков, непараметрической статистики и ранговой корреляции… и что это вообще за страшные слова? Какой линейкой это ты тут что-то измеряешь? А точно ли у тебя правильная линейка? В общем любопытство, помноженное на подозрение и некоторое сопротивление. Ну и третье — просто какая-то новая необычная штука появилась.
И реакция была от токсичной (в единичных проявлениях типа «не взять chatGPT — это кринж») до не просто конструктивной, а, я бы даже сказала за неимением другого слова, illuminating. И поскольку одной из задач на первый квартал следующего года мне хочется видеть если и не новый бенч, то какую-то адекватную методологию (разработанную советом старейшин инициативных умников, этакий White paper, рекомендованный сообществом стандарт проведения бенчмарков), для старта хочу здесь собрать основные идеи, возражения, комментарии, поступившие за прошедшие несколько дней.

Разбила их по смысловым группам:

1. Кто и как оценивает (субъект и процесс оценки)
Проблемы (🤔)
- субъективность и противоречивость human-eval, невозможность полностью её устранить
- влияние на оценку узнавания модели оценщиком
- разный уровень экспертизы оценщиков в разных областях
Идеи (😏)
- LLM-as-a-judge как более надежный метод, выражающий позицию «коллективного разума»
- метод Дельфи («второй раунд»)
- использование эталонных ответов от мэтров отрасли или базовых судебных решений для упрощения работы оценщиков

2. Критерии оценки
🤔
- использование эталонных ответов подходит не для всех ситуации (вопросы-кейсы, где нужно приняти риски, определить тактику / схему)
- в силу разных доктринальных позиций в праве часто нет единственно правильного ответа
- оценщикам предложены взятые «с потолка» критерии оценки, усиливающие субъективизм, а не какая-то четкая шкала
😏
- 100-балльная шкала вместо ранжирования (я ещё в процессе вспомнила своё муткортовское прошлое и судейство в настоящем, и это повышает объективность, но очень усложняет работу оценщика)
- использование в экспериментах «простых вопросов» с эталонными ответами и «вопросов-кейсов» с разными системами оценки

Продолжение в комментах (и в Телеграфе)! А вообще, спасибо всем огромное за интерес! Надеюсь до конца года вернуться ещё с какими-то новостями об этой истории.
Telegraph Пост рефлексии о бенчмарке В декабре 2025 года я с помощью 11 коллег, согласившихся уделить своё время на чтение большого количества нейросетевого текста, провела небольшой любительский human-eval бенчмарк (то есть без автоматизированной проверки по эталонным ответам) 5 нейросетевых…
  • ❤ 10
  • 🔥 4
More from @delay_rag
  1. Sep 14, 2026Я хотела перестать сообщать о #RAG_expansion в боте и поисковике, но тут произошло закрыти…
  2. Sep 12, 2026В рамках активностей Лаборатории МГЮА по ИИ провела в четверг занятие по самому элементарн…
  3. Aug 28, 2026В прошедшую среду выступила на прекрасно организованном командами HeadHunter и Moscow Lega…
  4. Aug 21, 2026Важная информация для коллег, использующих поисковик по практике ФАС и коннектор! 🤩 Конне…
  5. Aug 10, 2026Если вы хоть раз пользовались ботом @lastminute_legal_bot, то сегодня вы получили 🎉праздн…
  6. Aug 5, 2026Для замечательного издания Шортрид написала колонку о вайб-кодинге. Это скорее обзорный ма…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →