«Сбер» выпустил GigaChat 3.5 Reasoning с режимом рассуждений
Модель умеет разбивать сложные задачи на этапы, строить план, обращаться к поиску и другим инструментам, проверять промежуточные результаты и переделывать то, что пошло не так.
🔴Режим рассуждений включается отдельно. На простых запросах модель отвечает как обычно, а на сложных может потратить десятки тысяч токенов на поиск решения.
🔴В «Сбере» говорят о заметном приросте в программировании, логике и агентных сценариях, где нужно выполнить цепочку действий подряд.
Цифры по бенчмаркам;
▶️ IFBench - с 44 до 77 баллов ▶️ Natural Plan - с 64 до 80
▶️ Live Code Bench v6 - с 56 до 85
На математических задачах модель тратит примерно на 37% меньше токенов, чем DeepSeek V4 Flash Preview.
Как обучали
🔴Базой стала GigaChat 3.5 Ultra, представленная в июле. Модель гоняли на математике и коде с разными вариантами последовательностей действий, автоматическая проверка отбирала удачные пути решения, и они закреплялись при обучении.
Отдельно её научили понимать, когда пора лезть во внешний инструмент, а когда - вернуться и пересмотреть свои же предыдущие шаги.
⬛️И ещё - модель выложили под лицензией MIT, разработчики могут встраивать её в свои продукты бесплатно. Для рынка, где почти все прикладные решения строятся на открытых китайских моделях, это заметный шаг.
🦾 AI для бизнеса в Telegram | в MAX
Post #531
3.7K