MERA Text 2.0: новая версия бенчмарка
Команда MERA (это проект нашего Альянса в сфере ИИ) выпустила новую версию текстового бенчмарка для русскоязычных языковых моделей.
Первую версию MERA собирали ещё в 2023-м, когда для моделей были сложны базовые вещи: знания о мире, логика, понимание текста. Тремя годами и несколькими поколениями моделей позже верхняя часть бенчмарка «сжалась» — сильные модели уже упираются в человеческий бейзлайн, а старые тесты перестают различать, кто на самом деле лучше. Ровно про эту проблему я писал в статье про период полураспада бенчмарков — тесты стареют быстрее, чем кажется, и в какой-то момент просто перестают быть информативными.
Новая MERA пытается нащупать новую границу возможностей. Для этого была собрана линейка из четырёх групп, по три теста в каждой:
- Human-Centric — понимание метафор, юмора и характера собеседника. Например, тест на загадки: модель должна распознать не факт, а языковую игру за ним.
- Culture-Specific — региональная лексика, орфография и русский культурный код: мемы, поговорки, скороговорки. Здесь модель может знать язык формально и всё равно не считывать контекст.
- Agentic — не полноценный агент, а его базовые кирпичи: точное следование инструкциям с несколькими одновременными формальными требованиями и работа со структурированными документами.
- Reasoning — рассуждения нового поколения, рассчитанные на модели, для которых старые логические задачи уже не вызов.
Результаты топовых моделей ожидаемо сильно упали. Если в предыдущей версии лидеры показывали 80%+, то в 2.0 еще более современные модели имеют всего около 50-60%.
Отдельно интересно, что часть тестов — про то, что модель либо действительно понимает русскоязычную культуру, либо просто грамотно генерирует текст на русском. Это разные навыки, и предыдущее поколение бенчмарков их не различало.
Post #222
322

- 🔥 5
- ❤ 3
- 🤩 3