⚡️ Huawei представил результаты тестирования новой версии DeepSeek V4 на своём железе Ascend
Тесное взаимодействие инженеров на уровне чипов и моделей позволило Ascend раскрыть весь потенциал DeepSeek V4 — и вот что показали тесты.
📊 Результаты (входной промпт 8K):
• Ascend 950 SuperNode:
- DeepSeek V4-Pro: TPOT ≈ 20 мс, пропускная способность декодирования 4700 токенов/с на карту.
- DeepSeek V4-Flash: TPOT ≈ 10 мс, пропускная способность 1600 токенов/с на карту.
• Ascend A3 SuperNode (64 NPU, vLLM, сценарий 8K→1K):
- DeepSeek V4-Flash: 2000+ токенов/с на одну карту.
- V4-Pro на A3 тоже поддерживается, оптимизация продолжается.
🛠 За счёт чего такие цифры:
1. Архитектурные оптимизации чипа 950:
— Нативная поддержка FP8 / MXFP8 / MXFP4: память экономится на 50 %+, вычислительная мощность удваивается.
— Аппаратная оптимизация разреженного доступа к памяти — устранён bottleneck при маршрутизации экспертов в MoE.
— Объединённая память векторного (Vector) и матричного (Cube) блоков — убраны издержки на передачу данных внутри чипа.
2. Системный уровень:
— Ascend SuperNode решает задачу низкой задержки и высокого throughput на всём диапазоне от 4K до 1M токенов.
— Поддержка NAND SSU для дешёвого, ёмкого и быстрого KV Cache — критично для длинных контекстов.
3. Инструменты разработчика:
— PyPTO: Python-фреймворк для кастомных операторов. Разработка под конкретное железо сокращается до дней, ядра генерируются автоматически. Виртуальный набор инструкций PTO ISA обеспечивает совместимость кода между поколениями чипов без переделок.
— TileLang-Ascend: открытая реализация с Expert- и Developer-режимами. Код DeepSeek V4 уже выложен в сообществе TileAI.
🔗 Полная линейка Ascend (A2, A3, 950) поддерживает обе модели. Все инструкции, оптимизированные операторы и примеры обучения — в открытых репозиториях Huawei (CANN Recipes, MindSpeed-LLM, vLLM Ascend, SGLang).
💡 Раньше Huawei крайне неохотно делился цифрами производительности Ascend. Тот факт, что сейчас результаты публикуются оперативно и с такой детализацией, говорит сам за себя: технологии созрели, и компания больше не стесняется об этом говорить публично.
Подробнее в оригинальной статье
#Huawei #Ascend #DeepSeekV4 #КитайскийИИ #LLM #NPU
Post #232
4.35K
- 👍 1