Вышел GigaChat 3.5 Reasoning. Сбер выкатил модель под открытой лицензией MIT, так что веса доступны!
Обучили именно режим рассуждений: модель сначала планирует шаги, потом последовательно решает задачу и сама исправляет ошибки, если где-то ошиблась. Для длинного контекста использована архитектура с линейным вниманием. Говорят, что на математических задачах выходит в среднем на 37% меньше токенов по сравнению с DeepSeek V4 Flash Preview.
Прирост на бенчмарках:
— IFBench — с 44 до 77 баллов
— Natural Plan — с 64 до 80 баллов
— Live Code Bench v6 — с 56 до 85 баллов
Проверить рассуждения вживую можно прямо в ГигаЧате.
Модель лежит на Hugging Face и Gitverse, а подробные результаты расписали на Хабре.
Post #4100
6.18K

- 👍 78
- 🤬 8
- 🔥 7
- 👎 6
- ❤ 3
- 🤔 2