NVIDIA Nemotron 3 Ultra: что внутри флагманской MoE-модели👋 NVIDIA Nemotron 3 Ultra — крупнейшая модель в линейке Nemotron 3, ориентированная на агентные системы, рассуждения, кодинг, диалог и работу с длинным контекстом.
📌 Главный интерес — в том, как NVIDIA пытается совместить ёмкость крупной модели с более эффективным инференсом.
Что важно:
▪️ Гибридная архитектура Nemotron-H + LatentMoE
В модели используются 108 слоёв трёх типов: Mamba-2, Latent MoE и Attention. Значительная часть классических attention-слоёв заменена на Mamba-2, а экспертные вычисления вынесены в LatentMoE. Это снижает стоимость внимания и размер KV-cache, что особенно важно для длинноконтекстных задач и агентных цепочек.
▪️ LatentMoE вместо классической MoE-маршрутизации
Nemotron 3 Ultra содержит 550B параметров, из которых 55B активируются на токен. При этом токены перед маршрутизацией и вычислениями в экспертах проецируются в латентное пространство меньшей размерности. Такой подход делает маршрутизацию экономичнее по сравнению с классическими MoE-моделями.
▪️ Multi-Token Prediction для ускорения генерации
В архитектуру встроена Multi-Token Prediction — механизм, при котором модель может предсказывать несколько будущих токенов одновременно. Это помогает повышать пропускную способность инференса, особенно при генерации длинных ответов.
📲 Подробнее — в слайдах.
➡️
Запустить Nemotron 3 Ultra в квантизации 4 бита можно на 4 x H200 от 1 717,59 ₽/ч.➡️
Перейти в каталог с более чем 200 другими моделями.