#современныезнания #benchmarks #llm #ai
Как понять какая LLM лучше и почему?
MMLU (аббревиатура от Measuring Massive Multitask Language Understanding) — это эталонный набор задач (бенчмарк), предназначенный для оценки способностей больших языковых моделей (LLM) по широкому кругу предметных областей.
Бенчмарк был разработан в 2020 году командой исследователей под руководством Дэна Хендрикса (Dan Hendrycks) из UC Berkeley и опубликован на конференции ICLR в 2021 году.
Цель MMLU — проверить, насколько модель усваивает разнообразные знания и умения, приобретённые на этапе предобучения.
MMLU-Pro, например, использует 12к вопросов вместо 4-ёх :D
• Источник: https://systems-analysis.ru/wiki/MMLU_benchmark
• GitHub: https://github.com/hendrycks/test
• Публикация: https://arxiv.org/abs/2009.03300
• Пост на kaggle как это может работать: https://huggingface.co/blog/open-llm-leaderboard-mmlu
• Пост на huggingfacce про open llm leaderboard: https://huggingface.co/blog/open-llm-leaderboard-mmlu
• И еще можно гуглить про MMLU-Pro: дашик вот https://artificialanalysis.ai/evaluations/mmlu-pro
Post #147
114



- ❤ 1