DeepSeek-V4-Pro: что еще важно знать
👋 В каталоге immers.cloud доступна DeepSeek-V4-Pro — крупная открытая MoE-модель с 1,6 трлн параметров, 49 млрд активных параметров на токен и контекстным окном до 1 048 576 токенов.
⚙️ Ключевая особенность модели — гибридная архитектура внимания, которая снижает вычислительную стоимость работы со сверхдлинным контекстом.
Что важно:
▪️ Гибридное внимание: в CSA-слоях модель сжимает KV-кэш и выбирает релевантные блоки истории через DSA-индексатор, а в HCA-слоях использует сильную компрессию 1:128, чтобы выполнять глобальное внимание по длинной истории.
▪️ Локальная точность: параллельно работает Sliding Window — механизм локального скользящего окна. Он без сжатия обрабатывает ближайшие токены и помогает модели сохранять точную связь с текущим фрагментом контекста.
▪️ Обучающий стек: модель предварительно обучена на более чем 32 трлн токенов с оптимизатором Muon, а также использует mHC — Manifold-Constrained Hyper-Connections.
▪️ Режимы работы: доступны Non-think, Think High и Think Max — от быстрых ответов до более глубокого логического анализа для сложных задач.
📲 Подробнее в слайдах.
🚀 Запускайте DeepSeek-V4-Pro через каталог моделей immers.cloud для задач со сверхдлинным контекстом: документов, кода, исследовательских материалов и агентных workflow.
➡️ DeepSeek-V4-Pro
➡️ DeepSeek-V4-Flash
#ИИ_модели
Post #1171
594








- ⚡ 4
- ❤ 4
- 🔥 4
- 👍 2