TGViewer
🟢 Dragoy Everyday 🟢 🟢 Dragoy Everyday 🟢 @dra_goy · 1.84K subscribers
Post #2208 1.1K
Qwen3.8 на 5090 нашёл более быстрый llama.cpp

Наткнулся на buun-llama-cpp — форк обычного llama.cpp с умным KV-кэшем. Погонял Qwen3.8-27B на своей 5090 против билда, что уже стоял.

На коротких запросах быстрее заметно. На длинном контексте сильно, когда в промпте реально ~90–160K токенов, а не просто выставлен -c 262144.

Конфиг простой: buun, embedded MTP как раньше, KV не трогать он сам подстраивается. Sidecar MTP и turbo4 KV на длинном контексте мне не зашли.

Кто на 5090 и Qwen3.8 - попробуйте, разница на длинных сессиях ощущается сразу.

https://github.com/spiritbuun/buun-llama-cpp
  • 👍 7
  • ❤ 3
More from @dra_goy
  1. Sep 24, 2026photo post
  2. Sep 20, 2026Мой первый нефайнтюн релиз: https://huggingface.co/Dragoy/Swift-Qwen3.8-27B-abliterated-NV…
  3. Aug 16, 2026Реально рекомендую DeepSeek Harness тем, кто сейчас тестирует Qwen 3.8 27B локально. На ни…
  4. Aug 15, 2026Кароч в это трудно поверить! Но это уаншот от Qwen 3.8 27b! Чет мне не верится что мы дока…
  5. Aug 9, 2026Ха-ха, вот это приколямба: «Моддеры нашли способ получить доступ к полноценному рабочему с…
  6. Jul 28, 2026video post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →