Nvidia хакнула архитектуру LLM, скрестив Mamba, Transformer и MoE
Вышел Nemotron 3 Super — open-source монстр для агентного ИИ (120B параметров, активных всего 12B).
→ Архитектура: Инновационный LatentMoE сжимает токен перед отправкой к 512 экспертам. Это дает высокую специализацию без раздувания вычислительного бюджета.
→ Память: Слои Mamba-2 держат окно в 1M токенов без распухания KV-кеша, а Transformer-внимание страхует фактологическую точность.
→ Скорость (x5): Технология Multi-Token Prediction (MTP) дает нативное спекулятивное декодирование — генерация ~3.45 токена за один шаг.
→ Железо: Модель с первого дня обучалась в 4-битном формате NVFP4 под новые GPU Blackwell.
Nvidia открыла всё: веса, рецепты и датасет на 10 трлн токенов. Идеальная база для развертывания корпоративных multi-agent систем без привязки к платным API.
Готовы разворачивать этого зверя локально? 👇
🔥 — Уже считаю, сколько нужно VRAM
😀 — Только API, мои сервера этого не вынесут
#LLM #AIAgents #AI #architecture
(ИСТОЧНИК)
Post #301
143

- ❤ 5