TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1917 1.84K
Unsloth выкатили Gemma 4 NVFP4 quants.

Заявка простая: быстрее 4-bit inference на Blackwell GPU без обычного компромисса “сжали, но стало заметно тупее”.

Главные цифры:

* Gemma-4-12B NVFP4 запускается на 11 GB VRAM
* Gemma-4-26B-A4B доходит до 13K tok/s на B200
* NVFP4 даёт до 1.5× ускорения на GPU

NVFP4 - это не просто “ещё один 4-bit формат”. Он заточен под Blackwell и позволяет делать inference быстрее, сохраняя точность лучше, чем грубая квантизация.

Для локального и self-hosted inference это важный сдвиг: больше моделей помещается в память, throughput растёт, стоимость токена падает.

Особенно полезно для тех, кто гоняет много коротких запросов, агентные пайплайны или batch-инференс, где скорость и VRAM решают всё.

Blog: https://unsloth.ai/docs/basics/nvfp4
Gemma NVFP4: https://huggingface.co/collections/unsloth/nvfp4
  • 👍 4
  • ❤ 3
  • 🔥 2
More from @bigdatai
  1. Sep 18, 2026🔥 Ternary представила Bonsai 2 27B - тернарную версию Qwen3.8 27B размером всего 5,9 ГБ.…
  2. Sep 17, 2026Во время выполнения обычной задачи по программированию ChatGPT 6 Astra неожиданно начала п…
  3. Sep 16, 2026🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно тер…
  4. Sep 15, 2026🎙 Google выпустила Gemini 3.8 Live и Live Extended Thinking Модели поддерживают 97 языков…
  5. Sep 15, 2026Участвуй во всероссийском ИТ-чемпионате МТС True Tech Champ 2026 c призовой фондом 10 250…
  6. Sep 15, 2026🚨 Microsoft AI опубликовала первый публичный черновик Code of Conduct для своих MAI-модел…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →