🔘 llama.cpp 0.4.1: новые архитектуры Maple 20B-A1B (тернарный MoE, пока только CPU), Tencent Hy 4 и Spark2.5. Флаги
--mmap, --mlock и --direct-io убрали, вместо них единый --load-mode. Появился --log-jsonl для структурированных логов, --reasoning-preserve включён по умолчанию, у конвертера флаг --fuse-qkv. Починили нормализацию GDN для Qwen, Kimi и GLM и выделение KV-кэша под MTP у DeepSeek и GLM-MoE. DeepSeek V4.1 Flash и GLM-5.3-Flash пока не поддерживаются, PR открыты.🔘 vLLM 0.29.0: Model Runner V2 стал дефолтом для всех моделей, старый уберут в 0.32. Prefix caching для Mamba даёт 9–25% к времени первого токена,
python -m vllm.entrypoints.openai.api_server объявлен устаревшим в пользу vllm serve, all-reduce через FlashInfer включён по умолчанию.🔘 SGLang 0.5.19: beam search через
beam_width, lean attention на AMD до 1,52x по пропускной способности, W4A8 MoE на Hopper даёт DeepSeek-V4-Flash около 12% к выходному throughput.🔘 Ollama 0.34.1:
ollama create из MLX safetensors вышел из экспериментального статуса, а для GGUF теперь нужен тулинг llama.cpp; список моделей /api/tags на больших библиотеках отвечает за 294 мс вместо 3,1 с. В 0.34.0 модели Ollama подключаются к ChatGPT Desktop.🔘 exllamav3 1.5.0: быстрее prefill и decode у MoE. Qwen3.8-Flash-Next на RTX Pro 6000 прибавила 27% на prefill и 14% на decode, а с выгрузкой 80% весов на CPU через новый pinned arena prefill вырос на 54%.
🔘 halogen-flash-server: движок под одну карту и одну модель, Strix Halo и Qwen3.8-Flash-Next, без слоя переносимости. На промпте в 32K токенов полный ответ за 29 с против 118 с у других сборок под то же железо, 56 tok/s на ходе coding-агента, всё при 85 Вт. С версии 0.7.0 открывает обычный GGUF от llama.cpp.
@neuro_channel