TGViewer
MrGips • Про LLM MrGips • Про LLM @procomfy · 2.16K subscribers
Post #144 1.62K
Как же я недооценивал NVFP4

Сегодня шарился по реддиту и наткнулся на пост, где кто-то выдавил из 5090 почти 200 т/с (там есть нюанс - Linux).

Я тоже попробовал Qwen 3.8 27b в формате NVFP4, вместо стандартных Q4/Q5/Q6, которые я обычно использовал, и был приятно удивлен.

Но так как у меня Windows, скорость генерации на 5090 при полном контексте (262к!) достигала 137 токенов в секунду. А качество модели на уровне Q5 (если что, это утверждает GPT, не я). К слову, на Q5_K_XL при 130к контекста у меня 80-90 токенов в секунду. Как бы чувствуется разница слегка.

В НАШЕМ ЧАТЕ в разделе Тесты LLM, я успел немного погонять модельку. Продолжу дальше тестировать, что за зверь этот ваш NVFP4.

А вы пробовали? Что думаете?

Приятной генерации и быстрых токенов! А я всё, выключаю.
  • 🔥 12
  • ❤ 1
  • 👍 1
More from @procomfy
  1. Sep 22, 2026Alibaba анонсировала Qwen 4 На конференции Apsara алибабаевцы анонсировали Qwen 4. Пока эт…
  2. Sep 21, 2026Чуть потестил Qwen Image 2.1 Вроде неплохо. Правда долговато генерит конврот. Боюсь предст…
  3. Sep 20, 2026Deepseek V4.1 Flash VS GPT-6 Astra VS Qwen 3.8 27B (Ninfer) - Blender и Godot Тест Смотрет…
  4. Sep 20, 2026Qwen Image 2.1 релиз для ComfyUI Разбираем парни: https://huggingface.co/Comfy-Org/Qwen-Im…
  5. Sep 20, 2026Сегодня вечером новое видео Я так преисполнился дешевым Дипсиком V4,1 Flash что решил его…
  6. Sep 20, 2026Qwen-Image-2.1 - открытые веса нового генератора релизнут сегодня! Обратный отсчет тут: ht…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →