Авторы канала:
Алексей Русинов @Alexey_rsv
Глеб Шайхутдинов @glbst
Post #105
934
Бенчмарк_юридических_AI_моделей_2026.pdf264 KB
🔍Сравнили 5 нейросетей на юридических задачах. Вот что вышло
28 задач из практики: анализ договоров, составление исков, подбор судебной практики, консультации. Шесть отраслей права, три уровня сложности.
В оценке участвовало 5 моделей: НейроЮрист, Claude Sonnet 4.5, GPT-4o, ConsLegal (К+), GigaChat.
Каждый ответ оценивался по содержанию и форме, за галлюцинации - штраф.
✅Результаты (средний балл):
Claude Sonnet 4.5 — 2.27
НейроЮрист — 1.42
GPT-4o — 1.40
ConsLegal — 0.88
GigaChat — 0.37
Несколько наблюдений.
Claude сильнее остальных с большим отрывом. На сложных задачах это единственная модель, которая не уходит в минус. Проблема: нужен VPN.
НейроЮрист и GPT-4o набрали почти одинаково, но сильны в разном. НейроЮрист лучше ищет судебную практику по российскому праву: 1.38 против −0.06 у GPT. GPT лучше разбирает договоры: 2.81 против 1.50.
GigaChat пока не для юридических задач. Галлюцинации в каждой третьей задаче, семь задач с отрицательным баллом.
Все модели выдумывают. Claude — в 7% задач, GPT — в 21%, GigaChat — в 36%. Выдумывают номера дел, статьи, даты. Звучит убедительно, но при проверке оказывается ерунда.
🪙 Важно: это субъективный анализ одного юриста на ограниченной выборке. 28 задач - не тысяча. Для калибровки использовано второе мнение от Gemini 3 Pro. Это помогло избежать грубых ошибок, но не делает результаты истиной. Другой юрист с другими задачами может получить другие результаты. Относитесь к этому как к ориентиру, а не как к истине.
Полный отчёт в прикрепленном файле.
Интерактивный дашборд с подробными результатами по ссылке: https://russinovalex-ship-it.github.io/benchmark/
Технологии для юриста. Подпишись.
28 задач из практики: анализ договоров, составление исков, подбор судебной практики, консультации. Шесть отраслей права, три уровня сложности.
В оценке участвовало 5 моделей: НейроЮрист, Claude Sonnet 4.5, GPT-4o, ConsLegal (К+), GigaChat.
Каждый ответ оценивался по содержанию и форме, за галлюцинации - штраф.
✅Результаты (средний балл):
Claude Sonnet 4.5 — 2.27
НейроЮрист — 1.42
GPT-4o — 1.40
ConsLegal — 0.88
GigaChat — 0.37
Несколько наблюдений.
Claude сильнее остальных с большим отрывом. На сложных задачах это единственная модель, которая не уходит в минус. Проблема: нужен VPN.
НейроЮрист и GPT-4o набрали почти одинаково, но сильны в разном. НейроЮрист лучше ищет судебную практику по российскому праву: 1.38 против −0.06 у GPT. GPT лучше разбирает договоры: 2.81 против 1.50.
GigaChat пока не для юридических задач. Галлюцинации в каждой третьей задаче, семь задач с отрицательным баллом.
Все модели выдумывают. Claude — в 7% задач, GPT — в 21%, GigaChat — в 36%. Выдумывают номера дел, статьи, даты. Звучит убедительно, но при проверке оказывается ерунда.
🪙 Важно: это субъективный анализ одного юриста на ограниченной выборке. 28 задач - не тысяча. Для калибровки использовано второе мнение от Gemini 3 Pro. Это помогло избежать грубых ошибок, но не делает результаты истиной. Другой юрист с другими задачами может получить другие результаты. Относитесь к этому как к ориентиру, а не как к истине.
Полный отчёт в прикрепленном файле.
Интерактивный дашборд с подробными результатами по ссылке: https://russinovalex-ship-it.github.io/benchmark/
Технологии для юриста. Подпишись.
- 👍 14
- 🔥 9
- 👨💻 3












