У ГигаЧата теперь обновленный режим рассуждений
Недавно я писал про GigaChat 3.5 Ultra, а теперь у Сбера вышел GigaChat 3.5 Reasoning - та же модель на 432 млрд параметров, но с новым подходом к рассуждению. Она умеет разбирать задачу на этапы, строить план, проверять промежуточные результаты и самостоятельно править ошибки по ходу дела. Как и Ultra, её тоже отдали в опенсорс под лицензией MIT: веса лежат на Hugging Face и Gitverse, а на Хабре можно глянуть про весь процесс обучения.
Прирост по бенчам относительно версии без рассуждений, на самом деле, приличный: IFBench с 44 до 77, Natural Plan с 64 до 80, LiveCodeBench v6 с 56 до 85, GPQA-Diamond с 61 до 82. Получается, по среднему баллу модель вплотную подошла к DeepSeek V4 Flash, в следовании инструкциям и в структурированных ответах даже чуть обходит, хотя в агентном программировании и олимпиадной математике пока чуть отстаёт (сами авторы говорят, что это "домашняя работа уже для GigaChat 4").
Пару слов о том, как обучали. После обычного SFT (supervised fine-tuning, обучение на готовых примерах, что это такое - писал тут) модель прогнали через online RL, где её, грубо говоря, дрессировали как собачку: модель сама решала задачку, получала награду за верный результат, веса сдвигались в сторону удачных попыток, и так тысячи раз по кругу. Причём учили не одну модель сразу всему, а разделяли её на шесть отдельных "экспертов" - математика, код, кодовые агенты (это слегка разные вещи), function calling, диалог и инструкции. У каждого "эксперта" была своя награда и свои проверяемые среды. А потом их собрали обратно в одну модель через дистилляцию.
На всё это ушло девять месяцев, и, по словам команды, алгоритм - это наименьшая часть работы. Основное время сожрали эти самые среды с проверяемой наградой и ещё инфра, в которой RL такого размера вообще сходится. Команду могу только поздравить, ИМХО это очень серьёзный прогресс. Отдельно хочется сказать вот о чём:
Обычно режим рассуждений - это дорого. Модель думает дольше, а токены капают. Здесь же на сложной математике модель тратит в среднем на 37% меньше токенов, чем DeepSeek V4 Flash. Добились этого довольно творчески - заложили адаптивный штраф за длину: чем проще задача, тем сильнее наказание за лишние размышления. Это важно для внедрения в реальные юзкейсы - ризонинг из "премиум-фичи для демок" превращается в штуку, которую можно реально юзать по дефолту. Снова чёртов парадокс Джевонса, про которого я миллион раз уже писал.
В общем, логика та же, что и с Ultra: чем доступнее и дешевле модель, тем шире её будут внедрять. Только теперь дешевеет уже не просто токен, а сам процесс рассуждения. И для всех причастных индустрий это отличная новость.
Дизраптор
Post #3851
15.1K
- 👍 100
- 🔥 34
- ❤ 23
- 🤔 10
- 🙊 7
- ⚡ 6
- 😁 4
- 👨💻 4
- 🍾 3
- 🫡 2