Apple становится лучшей техникой для запуска локальных моделей
Почему так? Ollama переехал на MLX.
MLX — фреймворк от Apple для работы с нейросетями. Главная фишка: CPU, GPU и Neural Engine работают с единой памятью.
Решил протестировать на своём Mac Studio M2 Max, 32 Гб оперативки.
Пока что портировали только одну модель: qwen3.5:35b-a3b-coding-nvfp4.
На скринкасте можете увидеть метрики скорости. Скорость генерации — стабильные 54–55 токенов в секунду.
Что по кодингу
Запустил минималистичный кодинг-агент Pi на этой модели, дал простые задачки.
Удивился — насколько быстро и неплохо он их закрывал.
Но при достижении ~50% (70к из 128к) контекстного окна качество заметно падало.
Тем не менее — это уже достаточно сильный буст по сравнению с прошлым годом.
Post #523
2.18K