TGViewer
Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса @dialoger_tech · 256 subscribers
Post #271 524

Forwarded from Sber AI

Наши коллеги из AGI NLP SberAI и GigaCode SberAI вместе с другими участниками команды MERA из МТС AI, Т-банка, Ростелекома и Сибирских нейросетей выпустили новый бенчмарк MERA Code. Он позволяет более точно оценивать результаты LLM в задачах программирования, в том числе с учётом требований, сформулированных на русском языке.

Современные языковые модели для программирования (GigaChat, ChatGPT, Claude, Qwen, DeepSeek Coder и др.) сложно сравнивать между собой из-за отсутствия единого подхода к оценке. Они имеют разные наборы тестовых задач и условия замеров: разные датасеты, промптинговые стратегии и метрики. MERA Code стал первым шагом к решению этой проблемы.

Что внутри
🔘 11 задач в форматах text2code, code2text, code2code на 8 языках: Python, Java, C#, JavaScript, Go, C, C++ и Scala.
🔘 Открытая платформа с единой системой оценки, рейтингом и удобным фреймворком для тестирования
🔘 Анализ как открытых моделей, так и проприетарных API для генерации кода
🔘 Кодовая база, разработанная на основе LM Evaluation Harness


Авторы также предложили таксономию навыков, которая описывает ключевые способности LLM, необходимых для решения конкретных задач. В основе подхода — представление о модели как о системе из трёх компонентов:

вход → внутреннее состояние → выход


Исходя из этого, выделяются четыре базовых навыка:

🔘 восприятие (отвечает за входные данные)
🔘 логика и знания (внутренние характеристики модели)
🔘 генерация (отвечает за выходные данные)


Такую таксономию можно воспринимать как «карту навыков». Она показывает, что требуется от модели для успешного прохождения теста и какие области карты ещё не покрыты в бенчмарке.

➡️ Видеогайд, как замерить модель

MERA Code — шаг к честной, точной и воспроизводимой оценке LLM на русском языке. Присоединяйтесь к проекту, тестируйте свои модели и развивайте бенчмарк вместе с нами!

Подписывайтесь на наш канал 👈
  • 🔥 10
  • ❤ 1
More from @dialoger_tech
  1. Jul 1, 2026🚀 Мы на Hugging Face! Друзья, мы завели официальную страничку нашей компании Siberian Neu…
  2. May 8, 2026Интересная статья про победу наших коллег под руководством Ивана Бондаренко на IBM-овском…
  3. Mar 11, 2026💬 Встреча 💬 Тема: Почему ChatGPT ошибается? Галлюцинации генеративных моделей языка и ме…
  4. Feb 24, 2026✍️Локальный AI-ассистент Василиса — работает даже на парковке! 😱 Знаете этот страх — загр…
  5. Feb 23, 2026✍️🚀 Встречайте asr_eval: наш новый открытый инструментарий для оценки и сравнения ASR-мод…
  6. Dec 25, 2025🎉 Год прорыва: «Сибирские нейросети» в топе мировой науки! Подводим итоги 2025 года: наша…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →