Наткнулся на buun-llama-cpp — форк обычного llama.cpp с умным KV-кэшем. Погонял Qwen3.8-27B на своей 5090 против билда, что уже стоял.
На коротких запросах быстрее заметно. На длинном контексте сильно, когда в промпте реально ~90–160K токенов, а не просто выставлен
-c 262144.Конфиг простой: buun, embedded MTP как раньше, KV не трогать он сам подстраивается. Sidecar MTP и turbo4 KV на длинном контексте мне не зашли.
Кто на 5090 и Qwen3.8 - попробуйте, разница на длинных сессиях ощущается сразу.
https://github.com/spiritbuun/buun-llama-cpp
