TGViewer
Нейроканал Нейроканал @neuro_channel · 11.7K subscribers
Post #2892 1.56K
llama.cpp выпустила 0.4.1, и за ту же неделю обновились почти все движки локального инференса. Что важного для тех, кто гоняет модели у себя:

🔘 llama.cpp 0.4.1: новые архитектуры Maple 20B-A1B (тернарный MoE, пока только CPU), Tencent Hy 4 и Spark2.5. Флаги --mmap, --mlock и --direct-io убрали, вместо них единый --load-mode. Появился --log-jsonl для структурированных логов, --reasoning-preserve включён по умолчанию, у конвертера флаг --fuse-qkv. Починили нормализацию GDN для Qwen, Kimi и GLM и выделение KV-кэша под MTP у DeepSeek и GLM-MoE. DeepSeek V4.1 Flash и GLM-5.3-Flash пока не поддерживаются, PR открыты.

🔘 vLLM 0.29.0: Model Runner V2 стал дефолтом для всех моделей, старый уберут в 0.32. Prefix caching для Mamba даёт 9–25% к времени первого токена, python -m vllm.entrypoints.openai.api_server объявлен устаревшим в пользу vllm serve, all-reduce через FlashInfer включён по умолчанию.

🔘 SGLang 0.5.19: beam search через beam_width, lean attention на AMD до 1,52x по пропускной способности, W4A8 MoE на Hopper даёт DeepSeek-V4-Flash около 12% к выходному throughput.

🔘 Ollama 0.34.1: ollama create из MLX safetensors вышел из экспериментального статуса, а для GGUF теперь нужен тулинг llama.cpp; список моделей /api/tags на больших библиотеках отвечает за 294 мс вместо 3,1 с. В 0.34.0 модели Ollama подключаются к ChatGPT Desktop.

🔘 exllamav3 1.5.0: быстрее prefill и decode у MoE. Qwen3.8-Flash-Next на RTX Pro 6000 прибавила 27% на prefill и 14% на decode, а с выгрузкой 80% весов на CPU через новый pinned arena prefill вырос на 54%.

🔘 halogen-flash-server: движок под одну карту и одну модель, Strix Halo и Qwen3.8-Flash-Next, без слоя переносимости. На промпте в 32K токенов полный ответ за 29 с против 118 с у других сборок под то же железо, 56 tok/s на ходе coding-агента, всё при 85 Вт. С версии 0.7.0 открывает обычный GGUF от llama.cpp.

@neuro_channel
  • ❤ 7
  • 👍 2
  • 🔥 1
More from @neuro_channel
  1. Sep 20, 2026Tencent выложила WeVisDoc, модели на 2 и 4 млрд параметров, которые превращают снимок стра…
  2. Sep 19, 2026StepFun выпустила Step 5 Preview, и Artificial Analysis уже её замерили: 44 балла в индекс…
  3. Sep 19, 2026На следующей неделе ожидается сразу несколько крупных релизов. Расскажу про самые интересн…
  4. Sep 18, 2026Qwen выложила Qwen3.8-Omni-Flash: на вход текст, картинки, звук и видео, контекст 1M токен…
  5. Sep 18, 2026PrismML выпустила Ternary Bonsai 2 27B: тернарное сжатие теперь сделано поверх Qwen3.8 27B…
  6. Sep 17, 2026Стелс-модель Union Alpha раскрылась: это Pareto 26.9 от компании The Unbiased Company. Вче…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →