Всеобъемлющая статья про инференс LLM
Многие у меня спрашивают, как посчитать GPU и как после этого сохранить рассудок. Потому что насчитали столько, что даже начальник, который очень-очень любит ИИ, не окнет.
Теперь у меня есть для вас решение: прочитать мою статью и начать оптимизировать насчитанное.
Всю статью старался писать максимально простым языком, чтобы было понятно не только хардкорному инженеру. В ней есть:
- Как устроен инференс LLM
- Как оценить, сколько на него нужно GPU
- Какие есть методы оптимизации
- В каких движках это релизовано
Читайте, делитесь с друзьями.
И задавайте вовпросы в комментариях или в личные сообщения @seva_batareika.
Post #162
3.3K