TGViewer
RnD ML Team RnD ML Team @rndml_team · 4.16K subscribers
Post #498 3.15K
🔎 Модель говорит по-русски. А понимает? Пять новых линеек бенчмарков

На AI RnD Day наша уважаемая Алёна Феногенова представила 5 линеек русскоязычных тестов для оценки современных моделей.

📌 TLDR
Один общий балл в метрике плохо описывает модель для реального применения. Алена рассказала про 5 новых бенчмарков!
1️⃣ LIBRA проверяет работу с длинным контекстом, 2️⃣ MERA Reason — математические рассуждения, 3️⃣ MERA Text 2.0 — языковые, культурные и прикладные навыки, бенчмарки MERA разработаны совместно с Альянсом ИИ. 4️⃣ RUMBA оценивает память между сессиями, а 5️⃣ harness-bench-fast — работу в агентной обвязке: правильно выбрать тул в текстовой задаче и успешно выполнить действие в среде — не одно и то же. Результат зависит от всей связки — модель × обвязка × промпт × окружение.

📚 LIBRA Mini: поместилось в контекст ≠ прочитано
Из 18 задач полной LIBRA выбрали шесть сложных и показательных. Диапазон — от 4K до 512K токенов, запуск через lm-evaluation-harness. Здесь мало найти одну фразу: нужно связать факты из разных частей текста, ответить по нескольким статьям Wikipedia, определить человека по теме диалога или посчитать уникальные абзацы среди повторов.

Причем, у Qwen3-30B-A3B-Instruct-2507 итоговая оценка падает с 62,2 на 4K до 39,8 на 64K и 12,6 на 128K. Поэтому полезно смотреть не только на максимальное окно модели, но и на то, как меняется качество внутри него.

🧮 MERA Reason
Линейка объединяет Luzitania — 251 олимпиадную задачу, TMath — 310 задач с акцентом на комбинаторику, теорию чисел и геометрию, ruAIME — 724 задачи с проверкой точного совпадения ответа. А также MMReD: 128 шагов среды, вход около 8,7K токенов и рассуждение около 20K. Проверяется работа с длинной последовательностью шагов. Все тесты публичные.

⚙️ MERA Text 2.0: где модели ещё различаются
В новой версии 12 датасетов и около 8700 запросов — в 4,3 раза меньше прежнего объёма. Четыре группы: человеческая коммуникация, русскоязычный культурный контекст, базовые агентные навыки и рассуждение. Тесты приватные, результаты публикуются на лидерборде.

Особенно полезен Agentic-раздел: соблюсти 3–6 формальных требований в одном запросе, преобразовать YAML/CSV/XML целиком, выбрать инструмент из каталога на 14–22 тула. Именно он лучше всего разделяет сильные модели и следующий эшелон. Но это ещё текстовая проверка навыков, не полноценный запуск агента.

А понимание регионализмов, мемов и фольклора слабее связано с общим уровнем модели: высокий результат на других задачах его не гарантирует.

🧠 RUMBA: помнить нужно не всё подряд
В наборе 85 диалогов и 1543 вопроса. Проверяется извлечение фактов, рассуждение по истории и умение признать отсутствие информации. Есть и временная составляющая: если пользователь сначала любил розы, потом кактусы, а теперь лилии, ответить «розы» — ошибка, хотя такой факт в истории был.

Сравниваются два режима: весь диалог во входе и внешняя память/RAG. Простой RAG получает 68,89 по русскоязычной оценке LLM-судьи, memOS — 66,82, mem0 — 53,21. Сложнее — не обязательно лучше. Это сравнение показанных систем, не универсальный рейтинг подходов.

🛠 harness-bench-fast
Около 391 кейса на файлы, CLI, инструменты, инструкции, память, программирование и отладку. Результат проверяет код, без LLM-судьи. Заявлен локальный прогон примерно за 30 минут без Docker и без интернета для тестовой среды; есть поддержка Harbor и повторных запусков с pass@K. Бенчмарк команды @robofuture Кости Крестникова, который также выступал на конференции.

🔚 Выводы
Для выбора модели нужен профиль ограничений: где теряется контекст, устаревает память или ломается выполнение инструкций. А если внедряем агента, измерять стоит всю систему — хороший балл отдельной LLM ещё не обещает надёжной работы её обвязки.

🔗 Более подробно — в презентации Алены (в комментариях файлом) и в записи выступления (тайминг: 6:29:30).

🔗 Тесты и лидерборды
• LIBRA Mini
• MERA Reason
• MERA Text 2.0
• RUMBA
• harness-bench-fast

#benchmarks #evaluation #llm #agents #conference #paperwatch
  • 👍 5
  • 🔥 5
  • ❤ 3
More from @rndml_team
  1. Oct 2, 2026⚡️ FRIDA-Decisions: роутинг, гардрейлы и интенты по русскому тексту за ≈30 мс На хайпе наш…
  2. Oct 2, 2026📌 10 докладов AI RnD Day в одном посте 🎙 Где это видано, где это слыхано: управляемые Fu…
  3. Oct 1, 2026🧠 Долгосрочная омнимодальная память Нужный факт может остаться в старом диалоге, быть на…
  4. Sep 30, 2026🔎 Агент SMITH для поиска: маленькая модель ищет, большая — отвечает На AI RnD Day Артём С…
  5. Sep 28, 2026🎬 Как дать VLM понять длинное видео и не потерять смысл 5 минут видео при одном кадре в с…
  6. Sep 27, 2026🧠 Модель выбирает правду или просто то, что проще выучить? Спросите LLM, правда ли, что ч…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →