🤖 Ollama v0.19 — локальні моделі на Mac тепер літають
#producthunt
Ollama перейшов на Apple MLX — фреймворк, який використовує unified memory на повну. Результат: швидкість генерації зросла вдвічі.
Цифри на M5/M5 Pro/M5 Max:
→ Prefill: 1810 токенів/с (було 1154)
→ Decode: 112 токенів/с (було 58)
→ З Int4 квантизацією — до 134 токенів/с на генерації
Поки що працює тільки з Qwen3.5-35B-A3B в NVFP4-квантизації. Потрібен Mac з 32 ГБ+ RAM. Інші моделі додадуть пізніше — це ще preview.
Також завезли розумніший кеш: перевикористання між діалогами, чекпоїнти для швидшого старту, і краща евікція, яка зберігає спільні префікси довше.
Якщо ганяєш локальні моделі на маку — оновлюйся, різниця відчутна.
https://ollama.com/blog/mlx
📎 Читайте також:
→ LlamaBarn — менюбар для локальних LLM на Mac
→ Eney від MacPaw — локальний AI в Setapp
→ OpenCode — відкритий AI-агент для кодингу
Post #2880
378