Думаю те, кто хоть немного следят за развитием LLM знают, что не так давно вышла Qwen3.8-27B, которую может взять и использовать любой желающий. На неё очень хорошие отзывы, она реально умная и может успешно решать некоторые задачи. По моему опыту использования локальных моделей, именно модели Qwen давали самый хороший результат.
В общем, очень мне хотелось тоже её попробовать. Но сразу скажу, что на видеокарте с 8ГБ это пустая затея, кто бы что ни говорил. Ничего путного у меня не получилось, а заметку делаю, чтобы сэкономить чьё-то время, если кто-то начнёт мечтать о невозможном и задумает проводить такие же эксперименты.
Я перепробовал кучу настроек, но результата выше 2 токена в секунду не получилось. Теоретически, такой производительности может хватить на какие-то рутинные задачи, которые не требуют мгновенного выполнения, но у меня таких нет. А работать вручную с такой производительностью невозможно.
Самые хорошие результаты были получены с настройками из этого видео:
▶️ Запустил Qwen3.8 27B на одной видеокарте 8 ГБ! (Лучше, чем ожидалось)
- Модель - unsloth/Qwen3.8-27B-GGUF IQ4_XS
- Context length - не более 70к
- K и V Cache Quantization Type - Q4_0
- GPU Offload - 26
- CPU Thread Pool Size - по числу физических ядер CPU
- Speculative Decoding - MTP
- Max Draft tokens - 2
- Draft probability - 0.75
- Enable Thinking - True (поставить галку)
- Reasoning Budget - Off (убрать галку)
- Temperature - 1
- Top K Sampling - 20
- Repeat Penalty - 1
- Min P Sampling - 0
Остальное в дефолте. Не знаю, что там ожидалось (я про заголовок), но у меня иногда те же 2 токена в секунду на RTX 5060 8 ГБ получились, как и у автора. Иногда ниже. Я перечитал все комментарии с критикой и советами по изменению настроек, но лучше не стало. Пробовал некоторые другие советы - всё мимо. Потерял кучу времени, результата - 0. Теоретически можно ещё LLM помучать на тему этих настроек, но, думаю, смысла нет. Одно хорошо - уже прохладно стало, отопление ещё не включал, а пока с LLM работаешь🔥, кабинет обогревается до комфортной температуры.
С такой видюхой, как у меня, про локальные модели общего назначения проще забыть и вообще их не запускать. Результат будет хуже, чем почти на всех публичных бесплатных. Другое дело какие-то специализированные модели, например, для распознавания объектов на видеопотоке, или анализ фотографий с тем же распознаванием объектов или лиц, распознавание речи. Это уже будет рабочая тема. Я всё это делал, нормально работает, производительности этой видюхи хватает. А в общении в чате или агентском режиме ловить нечего. Оно работает и даже что-то делает, но как я сказал, хуже бесплатных публичных моделей, так что смысла нет мучать своё железо, пока они доступны.
А в целом модель умная. Поделал некоторые относительно простые вещи на ней. Работает медленно, но результат даже в такой заквантованной и ограниченной по ресурсам модели нормальные. Если чётко выдавать задания и не торопиться получить результат, она в фоне может делать дела.
———
ServerAdmin: 📱 Telegram | 🌐 Сайт | 📲 MAX 😩
#ai
Post #5814
6.73K



- 👍 70