TGViewer
ПУЛ Telegram ПУЛ Telegram @tgrussia · 52.4K subscribers
Post #42148 4.39K
На Хабре вышло независимое сравнение российских языковых моделей. В тесте участвовали Алиса, GigaChat Max и GigaChat Ultra. Их работу проверили на пяти открытых бенчмарках: Arena-Hard, WildBench, MultiChallenge, τ³ и ПРАКТ-120.

На коротких ответах разница между моделями минимальна. Но при усложнении задач и увеличении объема текста вперед уверенно выходит модель Сбера. Разрыв особенно заметен там, где нужно довести многосоставную задачу до конца по прописанным правилам – написать код или обработать объемное ТЗ.

На бенчмарке Arena-Hard из 750 задач с кодом и инструкциями GigaChat Ultra и Max чаще доводят расчёты до конца. По сумме парных сравнений Ultra показал наибольшую точность, Max занял второе место, Алиса — третье. подписывайся.
More from @tgrussia
  1. Sep 24, 2026Ключевые заявления премьер-министра Михаила Мишустина: В проекте бюджета на 2027-2029 годы…
  2. Sep 24, 2026Ключевые заявления главы ЦБ Набиуллиной: Высокая инфляция уже много лет вызывает обеспокое…
  3. Sep 24, 2026Минфин анонсировал с 1 октября изменения в "Семейной ипотеке". Предполагается дифференциац…
  4. Sep 24, 2026Дмитрий Медведев назвал кандидатуры на должности председателей комитетов Госдумы: Всего в…
  5. Sep 24, 2026Единая Россия выдвинула кандидатуру Вячеслава Володина на пост спикера Госдумы. В качестве…
  6. Sep 24, 2026ВЦИОМ: Большая часть россиян не поддерживает запрет соцсетей детям, а выступает только за…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →