TGViewer
Делай RAG Делай RAG @delay_rag · 1.41K subscribers
Post #75 1.01K
Внезапно контент про #делай_bench. В конце вопросики к вам, буду признательна за ваши мысли и релевантный опыт ☕️

Недавно я участвовала в интереснейшей беседе со специалистом по психометрике.
Психометрика — это область знаний о конструировании измерительных инструментов для конструктов, то есть характеристик и явлений, которые мы не можем наблюдать напрямую и к которым не применимы «физические» метрики: знаний, способностей, качества работы.

Психометрика решает три главные задачи:
🤩 валидность (измерено ли то, что заявлено)
🤩 надёжность (воспроизводимость результатов)
🤩 шкалирование (корректная агрегация оценок)
То есть если хочется сделать надёжный human eval, то, как мне кажется, без техник и инструментов психометрики получится что-то странное (например, мой бенч 😎).

Из разговора я вынесла две идеи:
1) для валидации и подтверждения статистической значимости исследований психометрические методы подбираются под конкретный корпус вопросов
2) вопросы при этом должны быть однородными, то есть проверяться должен один конструкт. Это описывается красивым, длинным и новым для меня словом — унидименсиональность. То есть тест / шкала / бенчмарк измеряют одну конкретную характеристику, а не какую-то смесь.
Посмотрим на вопросы из моего бенчмарка, что же мы видим:
Q1 (алименты): задача на расчёт и выбор подходящей нормы
Q2 (обратный переход права): задача на теоретический анализ доктрины
Q5 (кондиционер): запрос на написание пошаговой инструкции
Q7 (аукционы): консультация с оценкой рисков
Q9 (фармлицензия): поиск оптимального решения в регуляторных ограничениях

То есть вопросы ориентированы на разный тип мыслительной деятельности или же на разные когнитивные задачи. Когда я усредняю оценку по настолько разным задачам, то я измеряю абстрактную «спортивность» человека, смешав результаты по шахматам, пинг-понгу и фигурному катанию.

Так родилась гипотеза: нужно делать бенчамарк с блоками вопросов, которые были бы однородны и соответствовали одному конструкту. И такими конструктами могут быть конкретные когнитивные задачи, характерные для работы юриста, и которые можно аутсорсить нейросети. Так уйдёт весомая часть проблем, о которых я писала здесь, например, низкая согласованность экспертов по одному и тому же вопросу. И, соответственно, валидно и со статистически значимыми результатами сравнивать нейросети по классам задач, выдавая рекомендации не «эта нейросеть в целом лучше», а «нейросеть Х лучше справляется с задачей Y». Соответствующим образом формулировать бенчмарки, подбирать экспертов-оценщиков и списки сравниваемых сервисов (например, по задаче ресерча не брать нейросети без выхода в Интернет).

В рамках этой гипотезы встаёт первая и главная задача: декомпоновать юридическую деятельность на принципиальные типы когнитивных задач. Например, драфтинг документов / юридический анализ / риск-оценка фактических обстоятельств / консультирование.
Однодначно определиться с таким списком довольно сложно (в том числе прочертить границы между смежными типами задач), поэтому хочется услышать как можно больше юристов:
1. как вы могли бы поделить свою работу по классам когнитивных задач?
2. было бы вам полезно подбирать ИИ-сервисы исходя из оценки их способностей решать релевантные вам задачи?


Приглашаю порассуждать о своей работе, мне кажется, мы редко это делаем, так как привыкли воспринимать свою работу как единый поток, а не комплекс задач, задействующих разные когнитивные функции.
  • 🔥 12
  • 👍 5
More from @delay_rag
  1. Sep 14, 2026Я хотела перестать сообщать о #RAG_expansion в боте и поисковике, но тут произошло закрыти…
  2. Sep 12, 2026В рамках активностей Лаборатории МГЮА по ИИ провела в четверг занятие по самому элементарн…
  3. Aug 28, 2026В прошедшую среду выступила на прекрасно организованном командами HeadHunter и Moscow Lega…
  4. Aug 21, 2026Важная информация для коллег, использующих поисковик по практике ФАС и коннектор! 🤩 Конне…
  5. Aug 10, 2026Если вы хоть раз пользовались ботом @lastminute_legal_bot, то сегодня вы получили 🎉праздн…
  6. Aug 5, 2026Для замечательного издания Шортрид написала колонку о вайб-кодинге. Это скорее обзорный ма…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →