TGViewer
Generative Ai Generative Ai @deeplearning_ru · 3.7K subscribers
Post #1186 1.34K

Forwarded from Вайб-кодинг

Если у вас есть видеокарта с 8 ГБ VRAM, то у меня для вас хорошие новости.

Вчера чувак тестировал Unsloth Gemma 4 12B Q4_K_XL на карте с 8 ГБ VRAM.

Народ был в шоке и сразу спросил: А 25B+ модель на бюджетной карте вообще реально запустить?

Оказалось — да.

Чувак запускает локально огромную MoE-модель на 26 миллиардов параметров на обычном ноутбуке с RTX 4060 8 ГБ и 16 ГБ оперативки.

Что по скорости:
- стабильные 20 токенов/с на декодировании;
- скорость не проседает даже на длинных промптах;
- скормил ей промпт на 60k токенов - всё так же держит около 20 TPS.

По TTFT чудес нет. Огромный контекст нужно сначала обработать. Но при скорости prefill около 200 токенов/с ждать приходится недолго, пользоваться вполне комфортно.

И всё это без MTP. Главная причина — новые QAT-кванты Gemma 4 от Google. Файл весов unsloth gemma-4-26B-A4B-it-qat-UD-Q4_K_XL.gguf весит всего 13.2 ГБ, что для модели такого размера выглядит почти нереально.

Главный секрет — флаг -cmoe в llama.cpp. Он отправляет веса экспертов MoE в оперативную память, а GPU оставляет Attention и KV Cache. В результате VRAM не забивается под завязку, а скорость остаётся стабильной.

Флаги запуска:

-m "gemma-4-26B-A4B-it-qat-UD-Q4_K_XL.gguf" -cmoe -c 248000 -v


После запуска достаточно открыть веб-интерфейс на localhost и включить новый значок лампочки режима reasoning в поле ввода, чтобы наблюдать, как модель выполняет многошаговые рассуждения. 😒😒😒

А интеграция с Hermes Agent заняла буквально пару минут.
  • 🤯 6
  • ❤ 5
  • 😁 2
More from @deeplearning_ru
  1. Sep 18, 2026Очень хороший прогресс для локальных моделей. PrismML выпустила Bonsai 2 27B на базе Qwen3…
  2. Sep 17, 2026Google открыла исходный код ARTEMIS — инструмента, который позволяет ИИ управлять Android-…
  3. Sep 14, 2026Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей. В новом техническо…
  4. Sep 11, 2026Несчастное сознание дрозофилы наконец-то обрело счастье — ее научили смотреть тиктоки с ро…
  5. Sep 10, 2026Если вам не нравится, что при работе с ИИ история, настройки и данные отправляются на чужи…
  6. Sep 9, 2026🛡 LLM, Guardrails и Zero Trust: вебинары о безопасной работе с ИИ ➡️ 15 сентября Как защи…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →