Ураураураура!
Вы спрашивали, вы ругались, вы просили, вы недоумевали — а мы делали гигачат с ризонингом.
В этом релизе мы полностью пересобрали пайплайн обучения. Если раньше был "классический" дорльный пайп с претрейном -> двумя стадиями сфт -> дпо -> онлайн рл, то сейчас мы сделали как и все модные лабы типа MAI, DeepSeek и так далее, разумеется, со своими приколами. Мы взяли тот же самый претрейн, что и 3.5 Instant, потом заварили один большой общий колдстарт — сфт датасет с ризонингом, являющийся базой для RL — затем сделали доменных экспертов на математику, код, болталку и прочие области, а потом через on-policy дистилляцию сделали единую модель-генералиста. И это заработало!
Не обошлось и без курьёзов — модель на RL в какой-то момент смогла своими действиями уронить обучение, пыталась обойти защиту бенчмарков, подключаясь к интернету через тор (?!) и вообще всячески безалаберничала. Но мы всё равно её любим и ценим, так что всё прощается.
В этом релизе я со своей командой ещё плотнее занялся добавлением новых метрик, а так же скоростью и эффективностью замеров. Усилия, вложенные в это, окупились — благодаря нашей магии время замера основных бенчей снизилось с 35 часов до примерно 8, появились более сложные бенчмарки, результаты которых показывали командам данных и рл что нам надо в модели улучшать, да и в целом, головной боли из-за замеров стало значительно меньше.
По метрикам GigaChat 3.5 Reasoning приблизился к DeepSeek V4 Flash. Учитывая, что модель пишет аж на 37% меньше токенов во время ризонинга и в целом, супербыстрая (три MTP-головы!), выглядит круто! Ну а если и вы вдруг хотите тоже делать так, чтобы получалось круто, тратить миллионы долларов на эксперименты и иметь реальное влияние на ОЧЕНЬ большой и проект, то приходите к нам работать. У нас тут сложно. Но весело.
Длиннющий хабропост со всей мякоткой
Веса
Потыкаться (выберите режим "рассуждение")
Post #377
1.82K

- ❤ 43
- 🔥 23
- 👏 7
- 💩 3
- 👍 2
- ❤🔥 1
- 🥰 1
- 🤡 1
- 🤣 1