TGViewer
Дизраптор Дизраптор @disruptors_official · 73K subscribers
Post #3851 15.1K
У ГигаЧата теперь обновленный режим рассуждений

Недавно я писал про GigaChat 3.5 Ultra, а теперь у Сбера вышел GigaChat 3.5 Reasoning - та же модель на 432 млрд параметров, но с новым подходом к рассуждению. Она умеет разбирать задачу на этапы, строить план, проверять промежуточные результаты и самостоятельно править ошибки по ходу дела. Как и Ultra, её тоже отдали в опенсорс под лицензией MIT: веса лежат на Hugging Face и Gitverse, а на Хабре можно глянуть про весь процесс обучения.

Прирост по бенчам относительно версии без рассуждений, на самом деле, приличный: IFBench с 44 до 77, Natural Plan с 64 до 80, LiveCodeBench v6 с 56 до 85, GPQA-Diamond с 61 до 82. Получается, по среднему баллу модель вплотную подошла к DeepSeek V4 Flash, в следовании инструкциям и в структурированных ответах даже чуть обходит, хотя в агентном программировании и олимпиадной математике пока чуть отстаёт (сами авторы говорят, что это "домашняя работа уже для GigaChat 4").

Пару слов о том, как обучали. После обычного SFT (supervised fine-tuning, обучение на готовых примерах, что это такое - писал тут) модель прогнали через online RL, где её, грубо говоря, дрессировали как собачку: модель сама решала задачку, получала награду за верный результат, веса сдвигались в сторону удачных попыток, и так тысячи раз по кругу. Причём учили не одну модель сразу всему, а разделяли её на шесть отдельных "экспертов" - математика, код, кодовые агенты (это слегка разные вещи), function calling, диалог и инструкции. У каждого "эксперта" была своя награда и свои проверяемые среды. А потом их собрали обратно в одну модель через дистилляцию.

На всё это ушло девять месяцев, и, по словам команды, алгоритм - это наименьшая часть работы. Основное время сожрали эти самые среды с проверяемой наградой и ещё инфра, в которой RL такого размера вообще сходится. Команду могу только поздравить, ИМХО это очень серьёзный прогресс. Отдельно хочется сказать вот о чём:

Обычно режим рассуждений - это дорого. Модель думает дольше, а токены капают. Здесь же на сложной математике модель тратит в среднем на 37% меньше токенов, чем DeepSeek V4 Flash. Добились этого довольно творчески - заложили адаптивный штраф за длину: чем проще задача, тем сильнее наказание за лишние размышления. Это важно для внедрения в реальные юзкейсы - ризонинг из "премиум-фичи для демок" превращается в штуку, которую можно реально юзать по дефолту. Снова чёртов парадокс Джевонса, про которого я миллион раз уже писал.

В общем, логика та же, что и с Ultra: чем доступнее и дешевле модель, тем шире её будут внедрять. Только теперь дешевеет уже не просто токен, а сам процесс рассуждения. И для всех причастных индустрий это отличная новость.

Дизраптор
  • 👍 100
  • 🔥 34
  • ❤ 23
  • 🤔 10
  • 🙊 7
  • ⚡ 6
  • 😁 4
  • 👨‍💻 4
  • 🍾 3
  • 🫡 2
More from @disruptors_official
  1. Sep 20, 2026ИИ-Холостяк В Южной Корее 20 августа стартовало дейтинг-реалити, где участники строят отно…
  2. Sep 20, 2026Эпик-фейл Nike, три необычных бизнес-хода из Китая и экзотический способ дёшево тестироват…
  3. Sep 18, 2026Чел на этой картинке кормит ИИшку человеческой кожей Недавно из стелс-режима вышел довольн…
  4. Sep 18, 2026Харнесс решает всё больше Пару недель назад OpenAI выкатила GPT-6 Astra и пафосно объявила…
  5. Sep 17, 2026Ладно, AGI
  6. Sep 17, 2026Нашёл топовую историю из Кореи: В Сеуле есть магазин шмоток Tansanmagnesium. Название - ко…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →