Какое-то время назад смотрел видео (очень рекомендую), где обсуждалось, как выглядит современный inference в продакшене: MoE, батчинг, карточки и сеть Nvidia.
Дизайн карточек обусловлен требованиями последних моделей – и мне врезалось в память, что последние карточки могут потянуть 10Т (!!!) MoE модели. Это когда Large Language Model – это, например, 500-800B параметров.
Чуть отмотаем вперед – и начинают выходить DeepSeek v4 Pro (1.6T), Kimi K3 (2.8T) и, буквально сегодня, Qwen 3.8 (2.4T). Несколько триллионов параметров стремительно становятся нормой.
А теперь деталь, которая меня глубоко поразила. В недавнем релизе Thinking Machines Inkling отмечалось, что при ~1T весов, на обучение было суммарно (модель мультимодальная – так что текст + аудио + картинки + видео) потрачено порядка 45T токенов.
1Т весов, 45T токенов, Карл.
Иными словами – по 1 весу на каждые 45 (очень сильно не-уникальных) токенов, и это модель "всего" на 1T (не 3Т, и не 10Т).
Это, дамы и господа, уже территория обычного архиватора.
Даже не знаю, что тут сказать. Пути AGI неисповедимы.
– @pgregory
Post #144
577

- 👍 4
- 🤔 2
- 🤯 2
- 💯 1