TGViewer
Dimension AI | Dmitry Sirakov Dimension AI | Dmitry Sirakov @dimension_ai · 1.9K subscribers
Post #202 1.49K
GigaChat 3 Ultra - успех или провал? [Часть 1/4]

Команда GigaChat выкатила пост на Хабре про свою опенсорсную модель — GigaChat 3 Ultra Preview (целых 712B / 36B активных параметров, наравне с DeepSeek V3 (671B / 37B), чуть меньше Kimi K2 (1T / 32B) и больше Qwen3 (235B / 22B)). Очень интересный репорт, предлагаю обсудить.

Pretrain 😎

GigaChat 3 Ultra (далее - гигачат) использовал в претрейне 14T токенов, среди которых 5.5T - синтетические данные (порядка 40% от общего объема претрейна, ничего себе). Часть из них генерируются по PromptCOT. Суть: генерируем разнообразные задачи, а потом их решаем и «подкладываем» в датасет. Занимательно, что для генерации синтетики использовался кластер. Поэтому предполагаю, что применялись опенсорсные модели (а судя по архитектуре - вероятнее всего, и сам DeepSeek). Насколько это хорошее решение? Предлагаю обратиться к «старшим братьям».

Qwen3 235B - 36T токенов в претрейне. Откуда они их взяли? Давайте разбираться.
В репорте Qwen2.5-Coder есть фраза: «We used CodeQwen1.5, the predecessor of Qwen2.5-Coder, to generate large-scale synthetic datasets». Это касается Continuous Pretrain (проще говоря, инициализируют базовую модель Qwen2.5, у которой 18T токенов в претрейне, и дообучают на дополнительных 5.5T, где, судя по цитате выше, много синтетических данных).
В самом репорте Qwen2.5 пишут, что рост с 7T до 18T токенов был достигнут в том числе за счет генерации синтетики. Из этого хочется сделать вывод, что значительная часть датасета синтетическая. Здесь ребята делают ставку на то, что модель должна быть поменьше, а данных - побольше (в разных вариациях), и модель должна видеть их много раз, чтобы они «вдолбились» в такое маленькое число параметров.

Kimi K2 1T (почти в 4 раза больше, чем вышеописанный Qwen) имеет всего 15.5T токенов в претрейне. Неожиданный поворот событий. В репорте Kimi K2 поясняют это так: «Simply increasing the amount of data is not a long-term solution» (почти кидая камень в огород Qwen, у которого один из самых крупных датасетов на рынке, но это лишь мои догадки).
И что они делают? Они ПЕРЕФРАЗИРУЮТ качественные данные и учебники, подавая модели ту же информацию под другим углом, и, как заявляют, это помогает бороться с переобучением. А на параметры не обращаем внимания - главное, чтобы модель могла запомнить ту информацию, которую мы ей даем.

DeepSeek V3 671B, 14.8T в претрейне. Я не нашел в тех. репорте упоминания синтетики в контексте претрейна; вероятно, это чистые данные из доступных им источников. А «синта» использовалась на этапах SFT / RL, чего я пока не хочу касаться. Политика почти та же, что и у Kimi K2. На самом деле, архитектурно DeepSeek и Kimi K2 - практически одно и то же.
  • ❤ 12
  • 🔥 7
  • 👍 1
More from @dimension_ai
  1. Feb 18, 2026Sebastian Raschka что-то долго рисует архитектуру нового Qwen3.5-397B-A17B Решил сделать э…
  2. Jan 21, 2026Как на самом деле работает Thinking Mode (Interleaved vs Preserved thinking) и как применя…
  3. Nov 22, 2025GigaChat 3 Ultra - успех или провал? [Часть 4/4] Lightning 🤔 Модель Lightning - тоже MoE.…
  4. Nov 22, 2025GigaChat 3 Ultra - успех или провал? [Часть 3/4] SFT 🥳😘 Очень люблю команду GigaChat. В…
  5. Nov 22, 2025GigaChat 3 Ultra - успех или провал? [Часть 2/4] Какой вывод из этого можно сделать? В как…
  6. Oct 27, 2025Очень качественный подход для генерации синтетических данных для FC. Примечательно, что им…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →