🤘Топ вопросов с NLP собеседований: архитектуры LLM, инференс и оптимизация
очередная статья на хабр
На NLP/LLM собеседованиях все чаще проверяют не только знание трансформеров, но и понимание того, как устроены современные GPT-like модели: почему большинство генеративных LLM используют decoder-only архитектуру, чем LLaMA отличается от ванильного Transformer, зачем нужны RoPE, RMSNorm, SwiGLU и GQA.
Почему инференс LLM дорогой и какие оптимизации помогают его ускорять: fused kernels, FlashAttention, KV-cache и PagedAttention, continuous batching, speculative decoding, квантизация и дистилляция.
Много схем и картинок, а также полный список вопросов с собесов в конце.
статья:
https://habr.com/ru/articles/1068944/
уже 3-я статья на хабр подряд, а это значит, что скоро по этим темам выйдет большой собес на ютуб 🔥😋
по обучению писать в лс @abletobetable
Post #159
1.67K

- 🔥 25
- 🤩 3
- 🤝 2