Современный релиз языковой модели сопровождается отчётом с результатами на 40+ бенчмарках, причём те же самые оценки прогоняются многократно ещё до публичного релиза — чтобы отслеживать прогресс обучения, сравнивать архитектурные решения и выбирать лучший чекпоинт.
Авторы работы "You Don't Need to Run Every Eval" Ючень Зэн и Димитрис Папаилиопулос из подразделения Microsoft Research, AI Frontiers, задаются вопросом: а нужно ли вообще запускать все эти оценки?
Исследователи создали публичную матрицу оценок (score matrix), собрав результаты тестов 84 передовых моделей от 13 провайдеров (OpenAI, Google, Anthropic и др.) по 133 бенчмаркам. Матрица содержит 2604 наблюдаемых значения, что составляет лишь 23.3% от всех возможных ячеек.
📌 Ключевое открытие — матрица имеет эффективный ранг 2 (rank-2). Это значит, что оценки модели по всем 133 тестам в значительной степени определяются всего двумя скрытыми факторами. Матричное разложение с использованием SVD показало, что два фактора объясняют более 90% вариативности в оценках моделей;
Скрытые «два числа» — это не «интеллект» и «знания». Авторы не интерпретируют, что именно означают эти два фактора. Это приглашение для будущих исследований: что такое «ось X» и «ось Y» в пространстве способностей LLM?
На основе этой структуры был создан BenchPress — метод, который по небольшому набору известных оценок модели предсказывает все остальные с точностью ~4.6 балла.
Авторы обнаружили набор из пяти бенчмарков {GPQA-D, HLE, Codeforces, MMLU-Pro, ARC-AGI-1}, который восстанавливает остальные публичные оценки модели с точностью до 3.93 балла. Для меньшего вычислительного бюджета более дешёвый набор {GPQA-D, MMLU-Pro, Aider Polyglot, MATH-500, AIME 2026} позволяет предсказывать оценки с точностью до 4.55 балла.
О чем следует задуматься индустрии и не только?
1️⃣ Для разработчиков AI-моделей — прямая экономия ресурсов при итерациях. Вместо запуска десятков бенчмарков на каждом чекпоинте достаточно запустить 5, предсказав остальные. При сотнях итераций в процессе обучения это может сэкономить миллионы долларов и недели времени.
2️⃣ Для ИИ-исследователей — новая парадигма понимания способностей LLM. Если матрица оценок имеет ранг 2, значит за разнообразием задач стоят всего несколько фундаментальных способностей. Это ставит вопросы о природе «интеллекта» в современных LLM.
3️⃣ Для регуляторов и политиков — сигнал к пересмотру требований к тестированию. Если 133 бенчмарка несут не больше информации, чем 5, то регуляторные требования об «исчерпывающем тестировании» могут нуждаться в переосмыслении.
Неочевидные выводы
👉 «Гонка бенчмарков» теряет смысл. Компании публикуют десятки цифр при каждом релизе — не потому что они информативны, а потому что это стало индустриальным стандартом.
👉 Ранг 2 — это диагноз нынешнему поколению моделей. Авторы честно оговариваются: ранговая структура условна на текущем снапшоте из 84 моделей. Если появятся модели с принципиально новыми архитектурами или специализацией, например, только для биоинформатики, матрица может изменить ранг.
👉 Предсказание хорошо работает для «обычных» моделей, но ненадёжно для аутлаеров. Авторы разработали «уровень уверенности» именно потому, что для нетипичных моделей предсказания могут сильно ошибаться. Если вы разрабатываете действительно инновационную модель, вам всё равно придётся запускать полный набор оценок.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
