TGViewer
AI[ex]Time AI[ex]Time @aiextime · 2.83K subscribers
Post #8 1.23K
Отличная статья, где автор в деталях разбирает, на что уходит время во время инференса трансформеров. Если хочется понять все подробно, то можно на несколько часов уйти с головой. Рассказ строится вокруг Flops vs Memory boundness (которые зависят от модели, железа, формата инференса) и ситуаций, когда инференс упирается либо в одно, либо в другое. Автор разбирает разные ситуации (например, использование KV cache, Tensor/Pipeline parallelism, разный размер batch_size) и показывает, как и что меняется в зависимости от разных настроек. Плюс к этому дает некоторый фреймворк, по которому можно прикинуть суммарную latency LLM.

Сказал бы, что статья далеко не простая, но если вы занимаетесь деплоем LLM, то советую посмотреть.

В конце есть вопросы, чтобы проверить себя 💃
kipp.ly Transformer Inference Arithmetic This article presents detailed few-principles reasoning about large language model inference performance, with no experiments or difficult math.
  • ✍ 9
  • 👍 6
More from @aiextime
  1. Aug 25, 2026Еще немного интересных наблюдений из RL для MoE. В нем есть одна проблема, которая делает…
  2. Jul 27, 2026Какое-то время назад открыл для себя, насколько CISPO робастнее к выбору гиперпараметров п…
  3. Jun 29, 2026На следующей неделе я буду на ICML, в том числе презентовать с командой постеры по несколь…
  4. Jun 11, 2026Только успели выкатить мини-релиз SWE-rebench с Gemini 3.5 Flash, MiniMax M3 и Junie (тепе…
  5. May 29, 2026По горячим следам добавили Opus 4.8 xhigh, картина теперь такая
  6. May 28, 2026SWE-rebench давно не обновлялся. Все потому, что каждый месяц прогонять новые модели, да е…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →