Alex Smola (известный как пионер large-scale деплоя моделей и CEO Boson AI) выложил очень содержательную презентацию по Efficiency in LLMs, которую он расскажет Machine Learning Summer School (записи вроде не будет 😰).
В ней он рассказывает про:
• Современное железо и как оно влияет на инференс/обучение LLM
• Serving моделей
• Сжатие весов и KV-кэшей (затрагивая довольно свежие работты в том числе)
Рекомендую всем, желающим погрузиться в область или освежить знания.
Post #752
1.79K
- 🔥 23