🎙 Как ускорить работу LLM — в подкасте «От инженера слышу»
Почему мощная видеокарта не гарантирует быстрый ответ нейросети? И как обслуживать больше запросов на том же железе, не заставляя пользователей ждать?
В первом выпуске разбираемся, что происходит между отправкой запроса и появлением ответа. А также объясняем, как устроен инференс больших языковых моделей и что помогает сделать его быстрее и дешевле.
💬 Что ещё обсуждаем:
🟢 Чем обработка контекста отличается от генерации токенов
🟢 Как KV-кеш, квантование и спекулятивное декодирование помогают выжать больше из GPU
🟢 Как обрабатывать большой запрос одного пользователя, не тормозя остальных
🟢 Почему удачная оптимизация может оказаться бесполезной для конкретной нагрузки
🟢 Когда стоит разрабатывать свою библиотеку инференса и какую часть работы уже можно доверить AI-агентам
🔊 Слушайте выпуск на ютубе и в VK Видео
А больше о работе с LLM и других инженерных задачах бэкенда — на конференции «Я про бэкенд»
🈁 Регистрируйтесь и приходите за подробностями и опытом коллег
Подписывайтесь:
💬 @Yandex4Backend
📹 @YandexforBackend
Post #254
74
