🔥 DeepSeek v4.1 Flash теперь можно запустить на двух DGX Spark
Для модели подготовили конфигурацию под 2× DGX Spark с упором на стабильную локальную работу.
Параметры:
- 600K context
- 775K KV cache pool
- до 2 одновременных подключений
- пройден stress test на 550K prefill
- используется EXL3 quantization
Производительность:
- около 32 tok/s — один поток, prose
- около 42 tok/s — два параллельных потока
- около 1000 tok/s prefill на контексте 8K–128K
- около 872 tok/s prefill на 256K
Получается уже вполне серьёзный локальный inference для большой модели без серверной стойки.
GitHub:
https://github.com/MiaAI-Lab/DeepSeek-v4.1-Flash-EXL3-2x-DGX-Sparks
Post #5708
3.47K

- ❤ 6
- 🔥 3
- 👍 2
- 🎉 1