TGViewer
Maxim.ML - канал Maxim.ML - канал @ml_maxim · 1.05K subscribers
Post #54 580
Как устаревают бенчмарки: почему LLM становятся лучше по неочевидным причинам

Сижу на выходных, ищу интересные данные для примеров студентам и натыкаюсь на Hugging Face на любопытное предупреждение:

"You agree to NOT reveal examples from this dataset in plain text or images online, to reduce the risk of leakage into foundation model training corpora."


А тут еще и релиз Llama 4 с невероятными метриками по всем бенчмаркам... Давайте разберемся, почему каждая новая LLM-модель становится лучше, и не только благодаря усилиям R&D команд.

Утечка тестовых данных в тренировочные корпусы
Датасет с упомянутым предупреждением вышел в 2023 году и содержит 448 сложных вопросов с множественным выбором по биологии, физике и химии. Для контекста: эксперты с докторской степенью показывают на нем точность 65%, а высококвалифицированные неэксперты — только 34%, несмотря на подготовку 30+ минут с Google.

На Hugging Face можно получить данные этого бенчмарка, но вас попросят никуда их не выкладывать. Однако скачать все равно можно, поэтому логично предположить, что рано или поздно эти данные окажутся где-то в интернете. А значит, при следующем витке выгрузки всего интернета для обучения больших языковых моделей, эти данные попадут в тренировочный корпус, и модель начнет показывать на этом бенчмарке лучшие результаты, чем модели-конкуренты.

Проблема "просачивания" бенчмарков
Есть и более охраняемые бенчмарки, но правильные ответы новых сильных языковых моделей могут также быть хорошим обучающим материалом. Это означает, что качество на этих бенчмарках будет улучшаться по мере того, как модели будут постепенно усваивать тестовые примеры, опираясь на ответы «старших» моделей.

Другой показательный пример: известный бенчмарк “Humanity's Last Exam”, для создания которого привлекали экспертов со всего мира и платили до $5000 за один хороший экспертный вопрос, тоже доступен без особых проблем на Hugging Face.

Поиск новых методов оценки
Из-за всех этих проблем и недочетов существующих бенчмарков необходимо каждый раз придумывать новые. Но есть ощущение, что бесконечно придумывать новые мы не сможем, а значит, придется изобретать иные способы оценки.

Например, недавно проводили оценку моделей на мини-играх — насколько хорошо LLM играют в игры. Это интересный подход, которому сложнее "просочиться" в тренировочные данные. Или бенчмарк на умение проводить исследования, тоже нетипичный, пока что, вариант оценки.

#llm@ml_maxim

P.S. Кстати, хотите расскажу, как мы собирали бенчмарк на парах в Вышке для учебного проекта студентов — RAG-pipeline по книге «Война и мир»? Ставьте 🔥 и я поделюсь нашим опытом в этом 🦆
  • 🔥 11
  • ❤ 4
  • 👍 3
More from @ml_maxim
  1. Sep 17, 2026Тут huawei выпустила отчёт intelligent world 2035, там целых 10 смелых прогнозов, советую…
  2. Sep 14, 2026Показательно получилось 🛌 Вчера таки написал на habr про то, как легко теперь копировать…
  3. Sep 11, 2026Сходил за сырниками, а пришлось анализировать данные 📈 В магазине играла знакомая песня.…
  4. Sep 8, 2026Выхожу из декретного творческого отпуска 🛌 и сразу рассказываю свои апдейты и новости, на…
  5. Apr 14, 2026Архитектуру построили. А ML - нет 🤷‍♂️ Завершился наш с Никитой модуль по AI-агентам в ВШ…
  6. Mar 31, 2026Как неожиданно и приятно Месяц назад отправлял свою рукопись в ainl, сегодня пришёл резуль…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →