⚡️ NVIDIA представила Nemotron 3 Super и архитектура у модели очень необычная.
Это модель на 120B параметров, но во время работы активны только 12B. Такой результат достигается за счёт гибридной архитектуры Mamba + Transformer + MoE, которая позволяет получать высокую производительность при гораздо меньших вычислениях.
Что особенно выделяется:
• контекстное окно до 1 миллиона токенов
• 36 баллов в Artificial Analysis Intelligence Index — выше, чем у GPT-OSS-120B
• примерно на 10% больше throughput на GPU
• можно выбирать режим рассуждений: полный, облегчённый или отключённый — контролируя стоимость запроса
• модель обучена с нуля в NVFP4 precision, что впервые используется в этой линейке
• полностью открытые веса, данные и рецепты обучения — 83 балла в Openness Index
Но самое интересное - стратегия NVIDIA.
Компания больше не гонится за самыми большими моделями. Вместо этого ставка делается на максимальную эффективность.
Всего 12B активных параметров на 2× H100 дают уровень reasoning, который сопоставим с моделями, имеющими в 3–8 раз больше активных параметров.
Модель уже доступна на DeepInfra и Lightning AI со скоростью до 484 токенов в секунду.
https://artificialanalysis.ai/models/nvidia-nemotron-3-super-120b-a12b
Post #2601
4.3K

- ❤ 13
- 🔥 8
- 👍 4