Unsloth выкатили Gemma 4 NVFP4 quants.
Заявка простая: быстрее 4-bit inference на Blackwell GPU без обычного компромисса “сжали, но стало заметно тупее”.
Главные цифры:
* Gemma-4-12B NVFP4 запускается на 11 GB VRAM
* Gemma-4-26B-A4B доходит до 13K tok/s на B200
* NVFP4 даёт до 1.5× ускорения на GPU
NVFP4 - это не просто “ещё один 4-bit формат”. Он заточен под Blackwell и позволяет делать inference быстрее, сохраняя точность лучше, чем грубая квантизация.
Для локального и self-hosted inference это важный сдвиг: больше моделей помещается в память, throughput растёт, стоимость токена падает.
Особенно полезно для тех, кто гоняет много коротких запросов, агентные пайплайны или batch-инференс, где скорость и VRAM решают всё.
Blog: https://unsloth.ai/docs/basics/nvfp4
Gemma NVFP4: https://huggingface.co/collections/unsloth/nvfp4
Post #1917
1.84K

- 👍 4
- ❤ 3
- 🔥 2