Новый этап оценки больших языковых моделей для русскоязычного пространства: SLAVA
Большие языковые модели (LLM) все больше проникают в нашу жизнь, но как быть уверенными в их способности учитывать культурные особенности? Специально для оценки русскоязычных моделей создан бенчмарк SLAVA, разработанный в ИОН РАНХиГС.
Что такое SLAVA?
SLAVA — это бенчмарк, в котором более 14 тысяч вопросов, охватывающих такие области, как история, политология, социология и география. Особое внимание уделено чувствительным темам, важным для России, включая провокационные вопросы, чтобы оценить, насколько точно модели воспроизводят социальные и политические реалии.
Почему это важно?
Точность LLM имеет значение не только для науки, но и для повседневной жизни. В эпоху, когда ИИ активно внедряется в различные сферы, объективная проверка на релевантность и фактологичность в локальных контекстах становится необходимой.
Ключевые особенности
🌟 Оценка ответов на чувствительные вопросы (провокативность от 1 до 3 баллов).
🌟 Многовариантные и открытые вопросы, аналогичные ЕГЭ.
🌟 Поддержка адаптации и обновления бенчмарка каждые три месяца для актуальности в меняющемся социальном контексте.
Результаты SLAVA показывают, что модели от Gigachat, YandexGPT и qwen2 дают наибольшую точность, особенно на сложных вопросах. Будущие исследования помогут улучшить русскоязычные LLM, делая их еще более точными и культурно значимыми.
⛓Подробнее:
habr
Больше информации доступно на GitHub, Huggingface.
@gen_i_i
Post #984
515


- 🔥 7
- ❤ 5
- 👍 4