⚡️Сегодня мои бывшие коллеги из SberDevices (а ныне из большого Сбера) выкатили в open-source два свежих релиза GigaChat и рассказали об этом на Хабре. Поверьте, там есть о чём почитать.
Первая моделька — GigaChat 3 Lightning, компактная MoE-модель (≈10B общих, ≈1.8B активных). Работает локально на ноутбуке, отлично подходит для быстрых экспериментов и обучения на коленке.
А вот на второй стоит остановиться отдельно. GigaChat 3 Ultra Preview — новый флагман с 702 миллиардами параметров, из которых 36 миллиардов активны при генерации токена.
В чём крутость 702B-A36B:
🔘 Архитектурно ребята вдохновлялись идеями DeepSeek V3, где удачно сочетаются MoE с общими экспертами, MTP (Multi-Token Prediction) и MLA (Multi-head Latent Attention), а практические детали уже отработаны на уровне классов Hugging Face.
🔘 Pretrain-корпус вырос до 14 трлн токенов + ≈5.5 трлн синтетики. Разработчики ГигаЧата добавили 10 языков — от китайского и арабского до узбекского и казахского, — а также расширили набор источников: книги, академические данные, датасеты по коду и математике. Все данные проходят дедупликацию, языковую фильтрацию и автоматические проверки качества при помощи эвристик и классификаторов.
🔘При подготовке Pretrain-корпуса провели 179 экспериментов, тестируя различные комбинации естественных и синтетических источников: инструктивные данные, STEM-датасеты, «символьные» задачи и другие подходы.
🔘 Выстроили сложную MoE-кухню: балансировка экспертов, контроль перегрузок, мониторинг, чекпойнты по 10 ТБ.
🔘 Увеличили контекст до 128k. Модель обгоняет прошлое поколение по ключевым бенчмаркам.
🔘Ну и открытая MIT-лицензия даёт нормальную совместимость с open source-экосистемой. Можно брать модель и дорабатывать под себя.
Так как мой канал про контент, хочу немного приоткрыть занавес того, как подобные статьи на Хабр готовятся коллегами из Сбера. Спойлер: восхищаюсь этим подходом.
За этой и другими статьями Сбера про Гигу и вообще всё, что связано с AI, стоит достаточно большая команда очень крутых специалистов, которые с невероятным энтузиазмом увлечены своим делом.
Сложно поверить, но на написание подобной статьи, в бытность моей работы в Сбере, у нас уходило от 5 до 15 дней, и в этом очень большая заслуга непосредственно инженеров.
Если супер кратко, процесс всегда выглядел примерно так:
🔘в преддверии важного релиза мы собирали в чатик всех причастных;
🔘распределяли зоны ответственности;
🔘далее ребята-разработчики каждый детально расписывал свои куски текста.
Я, как оунер блога и главред в одном лице, полностью координировал процесс:
🔘собирал куски драфта в статью;
🔘приводил текст к единому стилю с учётом редполитики и здравого смысла;
🔘редактировал, вычитывал и писал вводную часть, а также заключение;
🔘на мне была подготовка визуалов и взаимодействие с командой дизайнеров;
🔘вся бюрократическая часть по согласованиям;
🔘верстка и публикация.
При такой слаженной работе мы готовили порой очень сложные технические тексты в считанные дни. И это правда очень крутой опыт. Прекрасно знаю, что так работает далеко не всегда и порой на написание подобного текста уходят месяцы.
Поздравляю с релизом всю команду GigaDev.
Ребят, вы крутые! Только вперёд🚀
https://t.me/systemofcontent
Post #11
107