Post #75
24.6K

🧠 GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями
Выкладываем в open source первую модель GigaChat с полноценным рассуждением. В основе — 432B-A28B MoE. После SFT мы обучили с помощью online RL шесть экспертов по разным направлениям: от математики и кода до агентов, диалога и следования инструкциям. Затем собрали их в одну модель через on-policy distillation: ученик генерирует ответ сам, а эксперт нужного домена оценивает каждый его токен, так что ничего из выученного в RL не теряется.
Что получилось по сравнению с GigaChat 3.5 Instant:
🔘SWE-Verified: 43 → 65
🔘AIME-2026: 67 → 92
🔘IFBench: 44 → 77
Рассуждения заметно усилили кодовые и базовые агентные навыки: модель вышла в паритет с сильнейшими открытыми и закрытыми моделями в следовании инструкциям, структурированной генерации и поиске информации в длинном контексте. При этом на сложной математике она тратит на 37% меньше токенов, чем конкуренты: высокие результаты не обязательно требуют более длинных рассуждений.
На внутренних корзинах в юридическом домене — экзамен по российскому праву, ответы по документам — модель показала себя лучшей среди доступных open source моделей. Также модель хорошо разговаривает на русском, имеет высокие показатели на внутренних и внешних аренах, обгоняя другие русскоязычные нейросети, в первую очередь за счёт фактической точности ответов.
Что интересного в обучении:
— Обучали модель на большом числе сред, а также сами построили 55 уникальных сред с проверяемым результатом, 12 тысяч задач, часть полностью на русском.
— Агент для кода учился внутри настоящих harness.
— Curriculum, который перед каждой стадией убирает уже освоенные задачи и позволяет сократить затраты на инференс вдвое.
— Нативный FP8 на всех этапах.
Подробнее о конвейере обучения, наградах и граблях, на которые мы наступили, — в статье на Хабре.
➡ Хабр: статья
➡ Hugging Face: fp8 | bf16
➡ GitVerse: репозиторий
Выкладываем в open source первую модель GigaChat с полноценным рассуждением. В основе — 432B-A28B MoE. После SFT мы обучили с помощью online RL шесть экспертов по разным направлениям: от математики и кода до агентов, диалога и следования инструкциям. Затем собрали их в одну модель через on-policy distillation: ученик генерирует ответ сам, а эксперт нужного домена оценивает каждый его токен, так что ничего из выученного в RL не теряется.
Что получилось по сравнению с GigaChat 3.5 Instant:
🔘SWE-Verified: 43 → 65
🔘AIME-2026: 67 → 92
🔘IFBench: 44 → 77
Рассуждения заметно усилили кодовые и базовые агентные навыки: модель вышла в паритет с сильнейшими открытыми и закрытыми моделями в следовании инструкциям, структурированной генерации и поиске информации в длинном контексте. При этом на сложной математике она тратит на 37% меньше токенов, чем конкуренты: высокие результаты не обязательно требуют более длинных рассуждений.
На внутренних корзинах в юридическом домене — экзамен по российскому праву, ответы по документам — модель показала себя лучшей среди доступных open source моделей. Также модель хорошо разговаривает на русском, имеет высокие показатели на внутренних и внешних аренах, обгоняя другие русскоязычные нейросети, в первую очередь за счёт фактической точности ответов.
Что интересного в обучении:
— Обучали модель на большом числе сред, а также сами построили 55 уникальных сред с проверяемым результатом, 12 тысяч задач, часть полностью на русском.
— Агент для кода учился внутри настоящих harness.
— Curriculum, который перед каждой стадией убирает уже освоенные задачи и позволяет сократить затраты на инференс вдвое.
— Нативный FP8 на всех этапах.
Подробнее о конвейере обучения, наградах и граблях, на которые мы наступили, — в статье на Хабре.
➡ Хабр: статья
➡ Hugging Face: fp8 | bf16
➡ GitVerse: репозиторий
- 🔥 110
- 👍 40
- ❤ 16
- 😁 14
- 🙏 1











