TGViewer
ServerAdmin.ru ServerAdmin.ru @srv_admin · 32.6K subscribers
Post #5814 6.73K
Думаю те, кто хоть немного следят за развитием LLM знают, что не так давно вышла Qwen3.8-27B, которую может взять и использовать любой желающий. На неё очень хорошие отзывы, она реально умная и может успешно решать некоторые задачи. По моему опыту использования локальных моделей, именно модели Qwen давали самый хороший результат.

В общем, очень мне хотелось тоже её попробовать. Но сразу скажу, что на видеокарте с 8ГБ это пустая затея, кто бы что ни говорил. Ничего путного у меня не получилось, а заметку делаю, чтобы сэкономить чьё-то время, если кто-то начнёт мечтать о невозможном и задумает проводить такие же эксперименты.

Я перепробовал кучу настроек, но результата выше 2 токена в секунду не получилось. Теоретически, такой производительности может хватить на какие-то рутинные задачи, которые не требуют мгновенного выполнения, но у меня таких нет. А работать вручную с такой производительностью невозможно.

Самые хорошие результаты были получены с настройками из этого видео:

▶️ Запустил Qwen3.8 27B на одной видеокарте 8 ГБ! (Лучше, чем ожидалось)

- Модель - unsloth/Qwen3.8-27B-GGUF IQ4_XS
- Context length - не более 70к
- K и V Cache Quantization Type - Q4_0
- GPU Offload - 26
- CPU Thread Pool Size - по числу физических ядер CPU
- Speculative Decoding - MTP
- Max Draft tokens - 2
- Draft probability - 0.75
- Enable Thinking - True (поставить галку)
- Reasoning Budget - Off (убрать галку)
- Temperature - 1
- Top K Sampling - 20
- Repeat Penalty - 1
- Min P Sampling - 0

Остальное в дефолте. Не знаю, что там ожидалось (я про заголовок), но у меня иногда те же 2 токена в секунду на RTX 5060 8 ГБ получились, как и у автора. Иногда ниже. Я перечитал все комментарии с критикой и советами по изменению настроек, но лучше не стало. Пробовал некоторые другие советы - всё мимо. Потерял кучу времени, результата - 0. Теоретически можно ещё LLM помучать на тему этих настроек, но, думаю, смысла нет. Одно хорошо - уже прохладно стало, отопление ещё не включал, а пока с LLM работаешь🔥, кабинет обогревается до комфортной температуры.

С такой видюхой, как у меня, про локальные модели общего назначения проще забыть и вообще их не запускать. Результат будет хуже, чем почти на всех публичных бесплатных. Другое дело какие-то специализированные модели, например, для распознавания объектов на видеопотоке, или анализ фотографий с тем же распознаванием объектов или лиц, распознавание речи. Это уже будет рабочая тема. Я всё это делал, нормально работает, производительности этой видюхи хватает. А в общении в чате или агентском режиме ловить нечего. Оно работает и даже что-то делает, но как я сказал, хуже бесплатных публичных моделей, так что смысла нет мучать своё железо, пока они доступны.

А в целом модель умная. Поделал некоторые относительно простые вещи на ней. Работает медленно, но результат даже в такой заквантованной и ограниченной по ресурсам модели нормальные. Если чётко выдавать задания и не торопиться получить результат, она в фоне может делать дела.

———
ServerAdmin: 📱 Telegram | 🌐 Сайт | 📲 MAX 😩

#ai
  • 👍 70
More from @srv_admin
  1. Sep 23, 2026Расскажу тем, кто не знает, и напомню тем, кто забыл, как я. Не надо в Proxmox в LXC конте…
  2. Sep 22, 2026Недавно случайно заметил любопытную информацию на тему Proxmox VE и новой функциональности…
  3. Sep 22, 2026✔️ Сети для всех — сообщество для тех, кто развивается в сетевом и системном администриров…
  4. Sep 22, 2026Я ранее уже рассказывал, что приобрёл себе домой полноценную серверную платформу на базе S…
  5. Sep 21, 2026Для тех, кто так же как и я упустил момент окончания поддержки релиза Debian 11 Bullseye,…
  6. Sep 21, 2026Для сайта, сервиса или следующего проекта 💯 У каждого проекта свои требования к инфрастру…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →