TGViewer
Пет-проект Пет-проект @petsproject · 16.9K subscribers
Post #4167 2.64K
Чекнул гайд по оптимизации локальных моделей через llama.cpp. Делюсь знаниями 😉

В нём затрагивают прям все аспекты, как выбрать лучшую модель, ускорить запуск или генерацию, а также повысить качество ответов при малых ресурсах ПК. Вытащил все главные финты и кратко описал:

• Включение XMP/EXPO в BIOS: зайдите в настройки BIOS, найдите раздел ОЗУ и активируйте профиль XMP (для Intel) или EXPO (для AMD). Это позволит памяти работать на полной скорости и сильно ускорит модель

• MTP (предсказание нескольких токенов): используйте модели, которые поддерживают MTP (например, Gemma 4), и запустите сервер с флагами:

--spec-draft-model путь_к_доп_модели.gguf

--spec-type draft-mtp

• QAT-квантизация: просто скачайте и используйте готовые QAT-версии моделей (например, Q4 QAT) — они уже специально обучены под сжатие и дают хорошее качество при меньшем размере

• Запуск на Linux: базовая база — это работа на Linux, где можно собирать llama.cpp из исходников — это даст заметный прирост скорости по сравнению с Windows

• tuned-ppd вместо power-profiles-daemon: на Linux установите tuned, включите профиль throughput-performance и перезагрузите систему

• Сборка llama.cpp из оптимизированных исходников: скачайте репозиторий, выполните сборку через cmake с нужными флагами (например, GGML_CUDA=ON) и используйте самую свежую версию

• Режим --fit: добавьте в команду запуска флаги --fit on --fit-target 512 (или больше) — программа сама оптимально распределит части модели между видеокартой и памятью

• Квантизация KV-кэша через флаги -ctk q8_0 -ctv q8_0. Освобождает много видеопамяти для дополнительных слоёв модели с минимальной потерей качества. Добавьте эти флаги при запуске сервера.

• Добавьте флаг --parallel 1: экономия видеопамяти, нужную для хранения истории разговора (особенно полезно для одного пользователя)

• Закрепление на быстрых ядрах (P-cores): даёт +20–30% скорости на процессорах Intel. Запускайте через taskset -c 0-11 (подберите номера ядер под свой CPU)

• Добавьте флаг --flash-attn on: обеспечивает стабильную работу с длинным контекстом

Флаг --no-mmap: убирает внезапные подтормаживания из-за доступа к памяти

• Флаг --mlock: не даёт системе «выталкивать» модель из памяти, предотвращая замедления во время долгой работы

• Перевод монитора на встроенную графику (iGPU): освобождает 500–1000 МБ видеопамяти. Подключите монитор к разъёму на материнской плате.

• Headless-режим: освобождает 200–400 МБ памяти и видеопамяти, убирая графический интерфейс. Выполните sudo systemctl isolate multi-user.target.

• Флаг --n-gpu-layers: позволяет вручную указать, сколько слоёв модели разместить на видеокарте для лучшей скорости

• Флаг --override-tensor: даёт точный контроль над размещением отдельных частей модели на CPU или GPU. Добавьте флаг с правилом, например --override-tensor ".ffn_(up|down|gate)_(ch|)exps=CPU".

• Параметр llama-fit-params: автоматически подбирает оптимальные настройки размещения модели. Запустите llama-fit-params -m ваша_модель.gguf -fitt 512 -fitc 65536

• Флаг --ctx-size: правильно задаёт размер контекста и влияет на использование памяти. Укажите --ctx-size 65536 (или нужное значение).

• Параметры batch-size и ubatch-size: ускоряют обработку промптов и работу с картинками. Добавьте --batch-size 1024 --ubatch-size 512 (для vision — меньше значения)

• Флаг --prio 2: повышает приоритет процесса и уменьшает подтормаживания от других программ

• Флаг --no-warmup: ускоряет запуск сервера

• Параметр GGML_CUDA_GRAPH_OPT: может снизить overhead и ускорить работу (но нужно тестировать). Выполните export GGML_CUDA_GRAPH_OPT=0 (или 1) перед запуском

• Хорошие кванты (UD-Q4_K_XL и подобные): лучше сохраняют качество модели при небольшом размере. Просто скачайте модель с таким квантом.

• Настройки для работы с картинками (vision): позволяют стабильно работать с изображениями на ограниченной видеопамяти. Добавьте --mmproj путь_к_файлу --fit-target 2048 --batch-size 256 --ubatch-size 512


Пользуемся.

Пет-проект
  • 🔥 16
  • 👍 5
  • 🤯 3
More from @petsproject
  1. Sep 30, 2026Google внезапно дропнул Gemini 4 Argon: • Лимит исходящих токенов — 1 млн, то есть умеет д…
  2. Sep 30, 2026Вайбкодер попросил у Opus 5.5 сделать «самое возвышенное, невероятно прекрасное, какое тол…
  3. Sep 30, 2026Никакого безопасного ИИ — Трамп и руководители Google, Anthropic, Meta, OpenAI, xAI и NVID…
  4. Sep 30, 2026Amazon и Google держат Anthropic в ежовых рукавицах — тут Reuters подсчитала сколько созда…
  5. Sep 29, 2026Вот насколько быстрее Ultrafast собирает приложения. На конфе в Ultrafast аппки собирали б…
  6. Sep 29, 2026OpenAI дропнула тариф за 500 баксов: • В 25 больше лимитов • Доступ к Ultrafast режиме — 3…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →