В нём затрагивают прям все аспекты, как выбрать лучшую модель, ускорить запуск или генерацию, а также повысить качество ответов при малых ресурсах ПК. Вытащил все главные финты и кратко описал:
• Включение XMP/EXPO в BIOS: зайдите в настройки BIOS, найдите раздел ОЗУ и активируйте профиль XMP (для Intel) или EXPO (для AMD). Это позволит памяти работать на полной скорости и сильно ускорит модель
• MTP (предсказание нескольких токенов): используйте модели, которые поддерживают MTP (например, Gemma 4), и запустите сервер с флагами:
--spec-draft-model путь_к_доп_модели.gguf
--spec-type draft-mtp
• QAT-квантизация: просто скачайте и используйте готовые QAT-версии моделей (например, Q4 QAT) — они уже специально обучены под сжатие и дают хорошее качество при меньшем размере
• Запуск на Linux: базовая база — это работа на Linux, где можно собирать llama.cpp из исходников — это даст заметный прирост скорости по сравнению с Windows
• tuned-ppd вместо power-profiles-daemon: на Linux установите tuned, включите профиль throughput-performance и перезагрузите систему
• Сборка llama.cpp из оптимизированных исходников: скачайте репозиторий, выполните сборку через cmake с нужными флагами (например, GGML_CUDA=ON) и используйте самую свежую версию
• Режим --fit: добавьте в команду запуска флаги --fit on --fit-target 512 (или больше) — программа сама оптимально распределит части модели между видеокартой и памятью
• Квантизация KV-кэша через флаги -ctk q8_0 -ctv q8_0. Освобождает много видеопамяти для дополнительных слоёв модели с минимальной потерей качества. Добавьте эти флаги при запуске сервера.
• Добавьте флаг --parallel 1: экономия видеопамяти, нужную для хранения истории разговора (особенно полезно для одного пользователя)
• Закрепление на быстрых ядрах (P-cores): даёт +20–30% скорости на процессорах Intel. Запускайте через taskset -c 0-11 (подберите номера ядер под свой CPU)
• Добавьте флаг --flash-attn on: обеспечивает стабильную работу с длинным контекстом
Флаг --no-mmap: убирает внезапные подтормаживания из-за доступа к памяти
• Флаг --mlock: не даёт системе «выталкивать» модель из памяти, предотвращая замедления во время долгой работы
• Перевод монитора на встроенную графику (iGPU): освобождает 500–1000 МБ видеопамяти. Подключите монитор к разъёму на материнской плате.
• Headless-режим: освобождает 200–400 МБ памяти и видеопамяти, убирая графический интерфейс. Выполните sudo systemctl isolate multi-user.target.
• Флаг --n-gpu-layers: позволяет вручную указать, сколько слоёв модели разместить на видеокарте для лучшей скорости
• Флаг --override-tensor: даёт точный контроль над размещением отдельных частей модели на CPU или GPU. Добавьте флаг с правилом, например --override-tensor ".ffn_(up|down|gate)_(ch|)exps=CPU".
• Параметр llama-fit-params: автоматически подбирает оптимальные настройки размещения модели. Запустите llama-fit-params -m ваша_модель.gguf -fitt 512 -fitc 65536
• Флаг --ctx-size: правильно задаёт размер контекста и влияет на использование памяти. Укажите --ctx-size 65536 (или нужное значение).
• Параметры batch-size и ubatch-size: ускоряют обработку промптов и работу с картинками. Добавьте --batch-size 1024 --ubatch-size 512 (для vision — меньше значения)
• Флаг --prio 2: повышает приоритет процесса и уменьшает подтормаживания от других программ
• Флаг --no-warmup: ускоряет запуск сервера
• Параметр GGML_CUDA_GRAPH_OPT: может снизить overhead и ускорить работу (но нужно тестировать). Выполните export GGML_CUDA_GRAPH_OPT=0 (или 1) перед запуском
• Хорошие кванты (UD-Q4_K_XL и подобные): лучше сохраняют качество модели при небольшом размере. Просто скачайте модель с таким квантом.
• Настройки для работы с картинками (vision): позволяют стабильно работать с изображениями на ограниченной видеопамяти. Добавьте --mmproj путь_к_файлу --fit-target 2048 --batch-size 256 --ubatch-size 512
Пользуемся.
Пет-проект
