Локальные LLM на iPhone: память, Core ML, MLX и ограничения
Поговорим про:
1. Архитектуру Apple Silicon и Unified Memory — почему не можем использовать всю доступную память;
2. Память, квантование и KV Cache — где приложения начинают падать и как это отловить;
3. Core ML и MLX — чем отличаются, где какой быстрее и почему нельзя всё запускать на нейронном процессоре;
4. Температуру и троттлинг — что происходит с телефоном на длинной сессии;
5. Гибридный пайплайн — как взять сильные стороны обоих фреймворков и получить стабильную генерацию. Это практический разбор с примерами кода, замерами на Llama 3 1B и выводами, когда локальная модель оправдана, а когда лучше использовать серверные модели.
Статья: https://habr.com/ru/articles/1064924/
Платформа: iOS
👨🦯➡️ AppFiles: код, инструменты, практики, производительность
Post #4360
386