TGViewer
AI VK Hub AI VK Hub @aihubvk · 2.49K subscribers
Post #588 1.33K
Обзор движков для инференса LLM

LLM-движок размещает веса и KV cache, собирает запросы в батчи, выбирает ядра и держит SLO по TTFT и TPOT. Выход длиной T токенов требует T последовательных decode-итераций, поэтому на каждом шаге движок решает, кого обработать следующим.

TensorRT-LLM
, LMDeploy, vLLM, SGLang и llama.cpp решают задачу с разными приоритетами. Как это происходит, рассказываем в карточках.

#aivkhub #llm #обзор
  • 🔥 8
  • ❤ 5
  • 👍 5
  • 💅 2
More from @aihubvk
  1. Sep 18, 2026Post #624
  2. Sep 17, 2026Вакансии для тех, кто хочет развивать рекомендательные системы и работать с большими модел…
  3. Sep 15, 2026Post #622
  4. Sep 11, 2026📱 Рекомендательные системы видео, клипов и постов работали раньше независимо: сигналы от…
  5. Sep 10, 2026Alignment: от ручной разметки к проверяемым наградам За аббревиатурами SFT, RLHF, PPO и GR…
  6. Sep 8, 2026На прошедших выходных прошла вторая встреча AI VK & Pro — место, где лиды ML и RecSys из б…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →