🔥 Perplexity разогнала локальный запуск LLM на Apple Silicon
Компания сделала собственный движок Lily специально под Mac и Qwen3.6-35B-A3B без PyTorch и MLX в цепочке выполнения.
На MacBook Pro с M5 Max и 128 ГБ unified memory:
- prefill: 5749 ток/с
- генерация: 186,6 ток/с
- в среднем prefill быстрее MLX-LM в 1,23×
- decode — в 1,35×
Что внутри:
- runtime на Rust
- собственные Metal-кернелы
- MoE-routing остаётся на GPU
- оптимизация отдельно под prefill и decode
- KV-cache и Gated DeltaNet заточены под Apple GPU
- 35B-модель ужата до 19,4 ГБ в 4-bit
На длинном контексте отдельная оптимизация attention дала до +40% скорости на 128K токенов.
Сам Lily Perplexity обещает скоро открыть.
https://www.perplexity.ai/hub/blog/optimizing-on-device-inference-for-apple-silicon
Post #2979
3.42K


- 🔥 13
- ❤ 5
- 👍 3