TGViewer
ml phys ml phys @mlphys · 2.89K subscribers
Post #227 2.63K
В чем ботлнек при работе ЛЛМки? Почему они не могут генерировать быстрее?

в GPU есть 2 основных ботлнека - память и компьют. Во первых нам надо считать все веса из VRAM в условные регистры, после чего произвести какие то вычисления.

Перед началой генерации надо рассчитать KV кеш по всем input токенам + считать веса модели один раз. В этом случае компьют является ботлнеком - время до первого токена это обьем вычислений / мощность гпу, более подробные вычисления приведены в картинках. Замечу что это теоретическая оценка. Из-за разных оверхедов реальные значения у vLLM будут на 20-30% хуже.

При генерации, на каждый токен надо считать веса 1 раз + forward pass для всего одного токена. В этом случае ботлнеком является уже скорость памяти, а не компьют, время генерации одного токена - размер модели / скорость памяти

Подумайте почему квантизации активно применяются для ускорения ЛЛМок, но вот в случае с дифузиями таким занимаются не так активно. Жду ваших версий в коментариях?
  • ❤ 10
  • 👍 4
  • 🔥 2
  • 🥰 2
  • 🤔 1
More from @mlphys
  1. Sep 20, 2026Дайте астре почилить хотя бы в воскресенье
  2. Sep 16, 2026https://mimo.xiaomi.com/rl/ Риал тайм дашборд трейнинга новой модели сиаоми
  3. Sep 10, 2026Изи
  4. Sep 8, 2026Очередной benchmark забенчмаксили , причем всего с 14 до 28 процентов, почему все так хайп…
  5. Sep 3, 2026Agi is here?
  6. Sep 1, 2026Post #343
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →