TGViewer
Digitable: Channel Digitable: Channel @digitable_blog · 203 subscribers
Post #147 114
#современныезнания #benchmarks #llm #ai

Как понять какая LLM лучше и почему?

MMLU (аббревиатура от Measuring Massive Multitask Language Understanding) — это эталонный набор задач (бенчмарк), предназначенный для оценки способностей больших языковых моделей (LLM) по широкому кругу предметных областей.

Бенчмарк был разработан в 2020 году командой исследователей под руководством Дэна Хендрикса (Dan Hendrycks) из UC Berkeley и опубликован на конференции ICLR в 2021 году.

Цель MMLU — проверить, насколько модель усваивает разнообразные знания и умения, приобретённые на этапе предобучения.

MMLU-Pro, например, использует 12к вопросов вместо 4-ёх :D

• Источник: https://systems-analysis.ru/wiki/MMLU_benchmark
• GitHub: https://github.com/hendrycks/test
• Публикация: https://arxiv.org/abs/2009.03300
• Пост на kaggle как это может работать: https://huggingface.co/blog/open-llm-leaderboard-mmlu
• Пост на huggingfacce про open llm leaderboard: https://huggingface.co/blog/open-llm-leaderboard-mmlu
• И еще можно гуглить про MMLU-Pro: дашик вот https://artificialanalysis.ai/evaluations/mmlu-pro
  • ❤ 1
More from @digitable_blog
  1. Sep 15, 2026Post #327
  2. Sep 4, 2026#games #steam #novel #casual В стиме сейчас анонсировали выход "Преступление и Наказание"…
  3. Sep 1, 2026#courses #features #calendar #planning #yearplanning На портале courses.digitable.ru появи…
  4. Aug 25, 2026#games #steam #arcade #casual Сегодня вышла в Steam (скоро и в Yandex Games, Ap Store, VK,…
  5. Aug 24, 2026#материалы #обучение #ИИ #llm #courses Зачем учиться, если модель пишет код быстрее вас и…
  6. Aug 14, 2026#материалы #courses #logic #Аристотель #Челпанов #логика #логическиеошибки Помните из детс…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →