TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2979 3.42K
🔥 Perplexity разогнала локальный запуск LLM на Apple Silicon

Компания сделала собственный движок Lily специально под Mac и Qwen3.6-35B-A3B без PyTorch и MLX в цепочке выполнения.

На MacBook Pro с M5 Max и 128 ГБ unified memory:

- prefill: 5749 ток/с
- генерация: 186,6 ток/с
- в среднем prefill быстрее MLX-LM в 1,23×
- decode — в 1,35×

Что внутри:

- runtime на Rust
- собственные Metal-кернелы
- MoE-routing остаётся на GPU
- оптимизация отдельно под prefill и decode
- KV-cache и Gated DeltaNet заточены под Apple GPU
- 35B-модель ужата до 19,4 ГБ в 4-bit

На длинном контексте отдельная оптимизация attention дала до +40% скорости на 128K токенов.

Сам Lily Perplexity обещает скоро открыть.

https://www.perplexity.ai/hub/blog/optimizing-on-device-inference-for-apple-silicon
  • 🔥 13
  • ❤ 5
  • 👍 3
More from @machinelearning_interview
  1. Sep 21, 2026SoftBank привлекает более $11 млрд ради новой инвестиции в OpenAI 🚨 SoftBank запустила ра…
  2. Sep 21, 2026Один вечер — много возможностей! ⚡️ 25 сентября у тебя будет шанс познакомиться сразу с че…
  3. Sep 21, 2026🔥 Hemmingway-1 - открытая модель, которая пытается писать как человек Модель построена на…
  4. Sep 20, 2026💰 Инвесторы допускают оценку Anthropic в $4 трлн после IPO, но дешёвые модели усиливают д…
  5. Sep 18, 2026photo post
  6. Sep 18, 202617 сентября в Москве прошла AI R&D DAY — конференция для исследовательских команд и создат…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →