TGViewer
Китай.AI Китай.AI @chinaaichannel · 1.28K subscribers
Post #232 4.35K
⚡️ Huawei представил результаты тестирования новой версии DeepSeek V4 на своём железе Ascend

Тесное взаимодействие инженеров на уровне чипов и моделей позволило Ascend раскрыть весь потенциал DeepSeek V4 — и вот что показали тесты.

📊 Результаты (входной промпт 8K):

• Ascend 950 SuperNode:
- DeepSeek V4-Pro: TPOT ≈ 20 мс, пропускная способность декодирования 4700 токенов/с на карту.
- DeepSeek V4-Flash: TPOT ≈ 10 мс, пропускная способность 1600 токенов/с на карту.

• Ascend A3 SuperNode (64 NPU, vLLM, сценарий 8K→1K):
- DeepSeek V4-Flash: 2000+ токенов/с на одну карту.
- V4-Pro на A3 тоже поддерживается, оптимизация продолжается.

🛠 За счёт чего такие цифры:

1. Архитектурные оптимизации чипа 950:
— Нативная поддержка FP8 / MXFP8 / MXFP4: память экономится на 50 %+, вычислительная мощность удваивается.
— Аппаратная оптимизация разреженного доступа к памяти — устранён bottleneck при маршрутизации экспертов в MoE.
— Объединённая память векторного (Vector) и матричного (Cube) блоков — убраны издержки на передачу данных внутри чипа.

2. Системный уровень:
— Ascend SuperNode решает задачу низкой задержки и высокого throughput на всём диапазоне от 4K до 1M токенов.
— Поддержка NAND SSU для дешёвого, ёмкого и быстрого KV Cache — критично для длинных контекстов.

3. Инструменты разработчика:
— PyPTO: Python-фреймворк для кастомных операторов. Разработка под конкретное железо сокращается до дней, ядра генерируются автоматически. Виртуальный набор инструкций PTO ISA обеспечивает совместимость кода между поколениями чипов без переделок.
— TileLang-Ascend: открытая реализация с Expert- и Developer-режимами. Код DeepSeek V4 уже выложен в сообществе TileAI.

🔗 Полная линейка Ascend (A2, A3, 950) поддерживает обе модели. Все инструкции, оптимизированные операторы и примеры обучения — в открытых репозиториях Huawei (CANN Recipes, MindSpeed-LLM, vLLM Ascend, SGLang).

💡 Раньше Huawei крайне неохотно делился цифрами производительности Ascend. Тот факт, что сейчас результаты публикуются оперативно и с такой детализацией, говорит сам за себя: технологии созрели, и компания больше не стесняется об этом говорить публично.

Подробнее в оригинальной статье

#Huawei #Ascend #DeepSeekV4 #КитайскийИИ #LLM #NPU
  • 👍 1
More from @chinaaichannel
  1. Jun 24, 2026🖥️ Китай вернул себе первое место в TOP500: суперкомпьютер LineShine лидирует в HPC Нацио…
  2. May 30, 2026🔥 Huawei обходит санкции США с помощью математики: представлен «закон масштабирования Тау…
  3. Apr 24, 2026🔥 DeepSeek V4 официально представлен! Сегодня DeepSeek анонсировал наконец релиз V4: комп…
  4. Apr 22, 2026🤖 Агенты перестают быть одиночками: китайский Kimi K2.6 совершает прорыв в командной рабо…
  5. Apr 20, 2026🤖 Робот с ИИ за час схватил 100+ незнакомых предметов. Как им это удалось? Китайский стар…
  6. Apr 13, 2026🔥 Huawei раскрывает амбициозный трёхлетний план: три поколения Ascend за три года Несмотр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →