На 37% меньше токенов тратит новая модель Сбера GigaChat 3.5 Reasoning на решение сложных математических задач по сравнению с открытой моделью DeepSeek V4 Flash Preview — при сопоставимом качестве ответов. Модель представлена 10 сентября, о разработке в компании рассказали через собственный технический блог.
Новая модель построена на базе GigaChat 3.5 Ultra, представленной в июле, и стала первой в линейке с полноценным режимом рассуждений: перед формированием ответа она разбивает задачу на этапы, составляет план решения, при необходимости обращается к поиску и другим инструментам и проверяет промежуточные результаты. Руководитель блока развития генеративного ИИ Сбербанка Антон Фролов формулирует это как переход от быстрого ответа к разбору сложной задачи. Практические сценарии применения — анализ договоров на противоречия, финансовые расчеты, поиск ошибок в коде, планирование многошаговых задач с учетом ограничений по бюджету и срокам. Пользователь включает режим рассуждений вручную для сложных запросов; для простых вопросов модель отвечает напрямую, не расходуя токены на пошаговый разбор.
Экономия токенов объясняется архитектурой модели. Всего в ней 432 млрд параметров, но при обработке каждого токена задействуется лишь 28 млрд — подход Mixture-of-Experts снижает объем вычислений на каждый запрос без потери качества результата. Обучение построено на шести отдельных экспертных модулях — математика, код, агентные задачи и другие, — каждый с собственной системой оценки, которые затем собраны в единую модель через технологию online RL: итоговая модель генерировала собственные решения, а профильный эксперт оценивал их на уровне отдельных токенов, что дало более точную обратную связь по сравнению с единой оценкой за весь ответ.
Стандартные бенчмарки подтверждают эффект: показатель IFBench вырос с 44 до 77 баллов, Natural Plan — с 64 до 80, LiveCodeBench v6 — с 56 до 85. В сравнении с DeepSeek V4 Flash Preview Reasoning модель Сбера обходит конкурента в следовании сложным инструкциям и структурированных ответах, но пока уступает в агентном программировании и олимпиадной математике — в компании обозначили это направлением для следующей версии.
Веса и код запуска модели опубликованы на Hugging Face по лицензии MIT, разрешающей в том числе коммерческое использование. Для крупной российской технологической компании открытие топовой модели такого уровня — нечастое решение, которое меняет расчет для разработчиков: вместо обращения к платному API появляется возможность развернуть модель на собственной инфраструктуре и встроить в свой продукт без лицензионных отчислений.
Для предприятия, выбирающего между облачным API и собственным контуром для задач с рассуждениями, экономия токенов напрямую переводится в стоимость эксплуатации: чем сложнее задача и чем больше шагов рассуждения она требует, тем заметнее разница в тридцать семь процентов на практике. Открытая лицензия добавляет к этому расчету второй параметр — возможность развернуть модель на собственных мощностях для задач с чувствительными данными, где отправка запросов во внешний API неприемлема, сохраняя качество рассуждений на уровне закрытых альтернатив.
Post #980
62
