🌟 Продолжаем открывать программу «Перфоманс Конф #12»
Следующий доклад — «Оптимизация инференса LLM: как ускорить модель, не меняя её и не докупая железо» от Алексея Фатеева.
LLM работают медленно, железо дорогое, а бизнес не готов ждать. Знакомая ситуация? В этом докладе — про работающие способы выжать максимум из того, что уже есть.
🌟 Что внутри
🌟 как ужать модель, чтобы она не поглупела — и когда этого делать не стоит;
🌟 какие параметры сервера реально влияют на скорость (и как их подбирать не на глаз, а автоматически);
🌟 три уровня кеширования запросов — как использовать их вместе и где кеш тихо портит ответы;
🌟 что делать, когда одной машины уже мало: как грамотно распределить нагрузку между несколькими GPU.
🌟 Кому точно будет интересно
ML-инженерам, архитекторам, SRE и всем, кто отвечает за то, чтобы модель отвечала быстро, а бюджет не улетал в бесконечную закупку железа.
🌟 Что унесёте с собой
Конкретные приёмы ускорения инференса, понимание, где искать узкие места, и готовые сценарии для масштабирования.
🌟 Спикеры, программный комитет и билеты — на сайте: perfconf.ru
Post #83
689

- 🔥 4
- 👍 1