Недавно я участвовала в интереснейшей беседе со специалистом по психометрике.
Психометрика — это область знаний о конструировании измерительных инструментов для конструктов, то есть характеристик и явлений, которые мы не можем наблюдать напрямую и к которым не применимы «физические» метрики: знаний, способностей, качества работы.
Психометрика решает три главные задачи:
🤩 валидность (измерено ли то, что заявлено)
🤩 надёжность (воспроизводимость результатов)
🤩 шкалирование (корректная агрегация оценок)
То есть если хочется сделать надёжный human eval, то, как мне кажется, без техник и инструментов психометрики получится что-то странное (например, мой бенч 😎).
Из разговора я вынесла две идеи:
1) для валидации и подтверждения статистической значимости исследований психометрические методы подбираются под конкретный корпус вопросов
2) вопросы при этом должны быть однородными, то есть проверяться должен один конструкт. Это описывается красивым, длинным и новым для меня словом — унидименсиональность. То есть тест / шкала / бенчмарк измеряют одну конкретную характеристику, а не какую-то смесь.
Посмотрим на вопросы из моего бенчмарка, что же мы видим:
Q1 (алименты): задача на расчёт и выбор подходящей нормы
Q2 (обратный переход права): задача на теоретический анализ доктрины
Q5 (кондиционер): запрос на написание пошаговой инструкции
Q7 (аукционы): консультация с оценкой рисков
Q9 (фармлицензия): поиск оптимального решения в регуляторных ограничениях
То есть вопросы ориентированы на разный тип мыслительной деятельности или же на разные когнитивные задачи. Когда я усредняю оценку по настолько разным задачам, то я измеряю абстрактную «спортивность» человека, смешав результаты по шахматам, пинг-понгу и фигурному катанию.
Так родилась гипотеза: нужно делать бенчамарк с блоками вопросов, которые были бы однородны и соответствовали одному конструкту. И такими конструктами могут быть конкретные когнитивные задачи, характерные для работы юриста, и которые можно аутсорсить нейросети. Так уйдёт весомая часть проблем, о которых я писала здесь, например, низкая согласованность экспертов по одному и тому же вопросу. И, соответственно, валидно и со статистически значимыми результатами сравнивать нейросети по классам задач, выдавая рекомендации не «эта нейросеть в целом лучше», а «нейросеть Х лучше справляется с задачей Y». Соответствующим образом формулировать бенчмарки, подбирать экспертов-оценщиков и списки сравниваемых сервисов (например, по задаче ресерча не брать нейросети без выхода в Интернет).
В рамках этой гипотезы встаёт первая и главная задача: декомпоновать юридическую деятельность на принципиальные типы когнитивных задач. Например, драфтинг документов / юридический анализ / риск-оценка фактических обстоятельств / консультирование.
Однодначно определиться с таким списком довольно сложно (в том числе прочертить границы между смежными типами задач), поэтому хочется услышать как можно больше юристов:
1. как вы могли бы поделить свою работу по классам когнитивных задач?
2. было бы вам полезно подбирать ИИ-сервисы исходя из оценки их способностей решать релевантные вам задачи?
Приглашаю порассуждать о своей работе, мне кажется, мы редко это делаем, так как привыкли воспринимать свою работу как единый поток, а не комплекс задач, задействующих разные когнитивные функции.