GigaChat переоценили
10 сентября Сбер представил GigaChat 3.5 Reasoning — новую версию своей нейросети с режимом рассуждений. В сообщении компании утверждалось, что по ключевым направлениям — следованию сложным инструкциям, планированию и написанию кода — модель «вплотную приблизилась к лучшим мировым моделям». В качестве подтверждения Сбер привел рост собственных результатов: 77 баллов в IFBench, 80 — в Natural Plan и 85 — в Live Code Bench v6.
Однако более широкая картина выглядит заметно скромнее. В новом российском бенчмарке MERA Text 2.0 именно GigaChat3.5-432B-A28B-Reasoning по состоянию на середину сентября занимает 13-е место с результатом 0,423. Первое место у Gemini 3.7 Flash — 0,678, далее идут GPT 5.6 Sol с 0,639, Claude Opus 5 с 0,631 и Grok 4.6 с 0,623. Таким образом, даже на русскоязычной площадке разрыв между GigaChat и верхней частью рейтинга остается существенным.
➡️ Подробнее в статье
Post #1090
616