TGViewer
SOF_news SOF_news @sof_news24 · 301 subscribers
Post #1736 88
⚔️🤖 Как установить Qwen3.8-27B GSQ+RCO за 10 минут: Ollama, LM Studio и llama.cpp
После выбора Qwen3.8-27B GSQ+RCO IQ3_S остаётся запустить модель локально. Специального программного обеспечения для GSQ или RCO не требуется: опубликован готовый файл GGUF размером 11,8 Гбайт, который поддерживается обычными средствами локального запуска.
📌 Самый простой вариант – LM Studio
После установки LM Studio необходимо обновить среду запуска llama.cpp: Ctrl+Shift+R – обновить runtime. Затем открыть Model Search и найти:
ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF

и скачать IQ3_S.
При первой загрузке модели целесообразно установить:
Context Length: 16384

GPU Offload: Max

Начинать сразу с заявленных 262K токенов не следует. Сначала проверяется работа на 16K, затем окно можно увеличить до 32–64K в зависимости от свободной видеопамяти. LM Studio позволяет заранее оценить расход памяти с учётом контекста и размещения модели на GPU.
🔻 Ollama
Сначала файл Qwen3.8-27B-GSQ-RCO-IQ3_S.gguf сохраняется, например, в:
C:\Models\Qwen38-GSQ\

В этой же папке создаётся файл Modelfile:
FROM ./Qwen3.8-27B-GSQ-RCO-IQ3_S.gguf

PARAMETER num_ctx 16384

После этого в PowerShell:
cd C:\Models\Qwen38-GSQ

ollama create qwen38-gsq -f Modelfile

ollama run qwen38-gsq

Проверить, где фактически выполняется модель:
ollama ps

Если часть вычислений перенесена на процессор, необходимо уменьшить контекст, освободить видеопамять либо перейти на IQ3_XXS размером 10,1 Гбайт. Импорт готовых GGUF через Modelfile является штатным способом работы Ollama с такими моделями.
🔻 llama.cpp – наиболее прямой вариант
В Windows установка выполняется командой:
winget install llama.cpp

После этого модель можно скачать с Hugging Face и сразу запустить:
llama cli -hf ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF:IQ3_S -ngl 99 -c 16384

-ngl 99 задаёт размещение максимально возможного числа слоёв на видеокарте, а -c 16384 – рабочий контекст.
Для подключения локального агента удобнее сразу поднять сервер:
llama serve -hf ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF:IQ3_S -ngl 99 -c 16384 --port 8080

В результате Qwen становится доступна локальным приложениям через API.
📌 Как настроить видеопамять
🔻 16 Гбайт VRAM – начать с IQ3_S + 8–16K контекста. Закрыть приложения, использующие GPU. Если памяти недостаточно – уменьшить контекст или использовать IQ3_XXS.
🔻 24 Гбайт VRAM – IQ3_S уже оставляет заметный запас. Практический рабочий диапазон для аналитического агента – 16–64K, увеличиваемый под конкретный документ или исследование.
🔻 262K имеет смысл включать только тогда, когда задача действительно требует такого объёма. Вместе с контекстом увеличивается размер KV-кэша, поэтому максимальное окно напрямую уменьшает запас памяти для других функций.
Проверить использование NVIDIA можно обычной командой:
nvidia-smi

Во время генерации должны быть видны занятая видеопамять и процесс программы, через которую запущена модель.
🔻 Мультимодальность подключается отдельно.
Для первого запуска достаточно самого IQ3_S.gguf. Если требуется анализ изображений, дополнительно загружается mmproj около 0,9 Гбайт, обеспечивающий обработку изображения и передачу полученных признаков языковой модели. Вариант с MTP также лучше подключать уже после проверки стабильной работы обычной IQ3_S.
  • 👍 2
More from @sof_news24
  1. Sep 30, 2026🧭 Военный календарь на 1 октября 2026 года Ежедневно – основные заранее объявленные мероп…
  2. Sep 30, 2026🇺🇸🇮🇶⚔️ США / Ирак: изменена система американского военного присутствия Центральное ком…
  3. Sep 30, 2026⚔️ Ежемесячный аналитический обзор (1–30 сентября 2026 г.) 🔻 В сентябре основным направле…
  4. Sep 30, 2026🧭 Аналитический обзор основных военно-политических событий в Восточной Европе (по состоян…
  5. Sep 30, 2026photo post
  6. Sep 30, 2026🇦🇿⚔️ Азербайджан: основные новинки и соглашения первого дня выставки «АДЕКС – 2026» В Ба…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →