🌐 ИИ — это круто, а с чего начать?
Запуская канал, я хотел ответить на этот вопрос
Но понял, что Это ПУТЬ, которым нужно следовать!
Предлагаю пройти его вместе ⤵️
@ii_papka
@ii_papka
@ii_papka
Заказ рекламы: https://vk.cc/cVZM1v
Post #1021
156

⚡️ Как ускорить локальный ИИ в 2–3 раза без покупки новой видеокарты
Для Mac
— использовать библиотеку MLX. Она работает с Unified Memory без лишних копирований. Прирост скорости — до +30–40%
— Квантовать KV-кэш (параметр --kv-bits 4 или 8). Сжатый кэш разгружает пропускную способность шины
Для NVIDIA (GeForce / DGX Spark)
— TensorRT-LLM: компилирует нейросеть в монолитный бинарник под ядра вашей карты. Самый быстрый способ инференса для NVIDIA
🚀 Главный чит
Спекулятивный декодинг
1. Берется тяжелая модель, например, на 150B+
2. К ней подключается братишка на 9-12B параметров
3. Мелкая модель генерит ответ, а старшая проверяет и фиксит
👍 — давай подробный гайд по настройке спекулятивного декодинга
🪐 Вездесущий ИИ | Чат с админом | Консультация
Стандартный GGUF — медленный, его можно сильно ускорить :)
Для Mac
— использовать библиотеку MLX. Она работает с Unified Memory без лишних копирований. Прирост скорости — до +30–40%
— Квантовать KV-кэш (параметр --kv-bits 4 или 8). Сжатый кэш разгружает пропускную способность шины
Для NVIDIA (GeForce / DGX Spark)
— TensorRT-LLM: компилирует нейросеть в монолитный бинарник под ядра вашей карты. Самый быстрый способ инференса для NVIDIA
🚀 Главный чит
Спекулятивный декодинг
1. Берется тяжелая модель, например, на 150B+
2. К ней подключается братишка на 9-12B параметров
3. Мелкая модель генерит ответ, а старшая проверяет и фиксит
👍 — давай подробный гайд по настройке спекулятивного декодинга
🪐 Вездесущий ИИ | Чат с админом | Консультация


















