TGViewer
Dimension AI | Dmitry Sirakov Dimension AI | Dmitry Sirakov @dimension_ai · 1.91K subscribers
Post #203 1.6K
GigaChat 3 Ultra - успех или провал? [Часть 2/4]

Какой вывод из этого можно сделать?


В каком-то смысле здесь сталкиваются две стратегии: Chinchilla-Optimal, DeepMind и Inference-Optimal, Meta*.

1. Chinchilla-Optimal. Суть - подобрать размер модели и объём данных так, чтобы получить минимальный LOSS за фиксированный бюджет обучения. Подробнее можно глянуть у Игоря Котенкова в его плейлисте история GPT, у него всё изложено по полочкам, в последовательном (историческом) порядке и даст понимание, какие там были интриги и разоблачения.

2. Inference-Optimal. Суть - обучение стоит очень дорого, но оно РАЗОВОЕ, а инференс - БЕСКОНЕЧНЫЙ. Поэтому давайте оверфитить модель до предела, чтобы выжать из параметров максимум, но сделать её максимально дешевой, эффективной в запуске и, как следствие, удобной для использования в продуктовых задачах.

Шиншилла:

DeepSeek (671B): должно быть 671B * 20 = 13.4T в обучении, а по факту - 14.8T. То есть максимально оптимальное обучение по Шиншилле

Kimi K2 (1T): должно быть 1000B * 20 = 20T токенов в обучении, а по факту - 15.5T. Да, модель недообучена и неэффективна, но, думаю, здесь ставка была сделана на 1T параметров с расчетом на последующее сжатие в различных форматах.

Qwen3 (235B): должно быть 235B * 20 = 4.7T токенов в обучении, а по факту - 36T токенов. То есть Qwen получил почти в 7.5 РАЗ БОЛЬШЕ ДАННЫХ, ЧЕМ НУЖНО. Лишь бы модель была ёмкой и быстрой в инференсе для пользователей и бизнеса (Alibaba Cloud, удобный инференс на одной карте - думаю, это связано).

А что делает GigaChat?
По Шиншилле - оптимально, но количество синтетики неприлично большое. Ладно бы, если бы это был в основном рерайт (как у Kimi), а так получается, что это дистилляция опенсорс-модели (в духе DeepSeek, когда они обучали Qwen и Llama на синтетике от большой модели).

В этом нет ничего плохого (даже с учетом громких заявлений, что это не Дипсик, мы не как яндекс, не путайте пжпжпж. Хотя размер претрейна - одинаковый, а по результатам +- сопоставимых моделей по размеру яндекса лучше) и вообще к нему отношения не имеет, хотя 40% данных кем-то сгенерированы), но, кажется, результат можно было сделать лучше. Либо уменьшить количество параметров и «накормить» её 15T токенов (как делал, например, Яндекс в GPT 5 Lite), либо уменьшить «синту» и уделить еще больше внимания добыче, фильтрации данных и подаче их под разными углами, как делает это Kimi K2.

* Meta признана экстремистской организацией и запрещена на территории РФ.
  • ❤ 11
  • 🔥 6
  • 👍 1
More from @dimension_ai
  1. Feb 18, 2026Sebastian Raschka что-то долго рисует архитектуру нового Qwen3.5-397B-A17B Решил сделать э…
  2. Jan 21, 2026Как на самом деле работает Thinking Mode (Interleaved vs Preserved thinking) и как применя…
  3. Nov 22, 2025GigaChat 3 Ultra - успех или провал? [Часть 4/4] Lightning 🤔 Модель Lightning - тоже MoE.…
  4. Nov 22, 2025GigaChat 3 Ultra - успех или провал? [Часть 3/4] SFT 🥳😘 Очень люблю команду GigaChat. В…
  5. Nov 22, 2025GigaChat 3 Ultra - успех или провал? [Часть 1/4] Команда GigaChat выкатила пост на Хабре п…
  6. Oct 27, 2025Очень качественный подход для генерации синтетических данных для FC. Примечательно, что им…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →