TGViewer
Yandex for Backend Yandex for Backend @yandexforbackend · 10.2K subscribers
Post #1102 1.13K
🎙 Как ускорить работу LLM — в подкасте «От инженера слышу»

Почему мощная видеокарта не гарантирует быстрый ответ нейросети? И как обслуживать больше запросов на том же железе, не заставляя пользователей ждать?
В первом выпуске разбираемся, что происходит между отправкой запроса и появлением ответа. А также объясняем, как устроен инференс больших языковых моделей и что помогает сделать его быстрее и дешевле.

💬 Что ещё обсуждаем:

🟢 Чем обработка контекста отличается от генерации токенов

🟢 Как KV-кеш, квантование и спекулятивное декодирование помогают выжать больше из GPU

🟢 Как обрабатывать большой запрос одного пользователя, не тормозя остальных

🟢 Почему удачная оптимизация может оказаться бесполезной для конкретной нагрузки

🟢 Когда стоит разрабатывать свою библиотеку инференса и какую часть работы уже можно доверить AI-агентам

🔊 Слушайте выпуск на ютубе и в VK Видео
А больше о работе с LLM и других инженерных задачах бэкенда — на конференции «Я про бэкенд»

🈁 Регистрируйтесь и приходите за подробностями и опытом коллег

Подписывайтесь:

💬 @Yandex4Backend
📹 @YandexforBackend
  • ❤ 7
  • 🔥 4
  • 👍 2
  • 🤓 2
  • ❤‍🔥 1
  • 🙏 1
  • 👌 1
More from @yandexforbackend
  1. Sep 24, 2026💹 Делимся записями с deep tech night 5 сентября прошла масштабная конференция Яндекса о т…
  2. Sep 22, 2026Post #1100
  3. Sep 21, 2026Post #1099
  4. Sep 18, 2026🔠 Приглашаем в Архитектурный клуб Яндекс 360 Это открытое сообщество для архитекторов и и…
  5. Sep 17, 2026🏆 Международное соревнование для разработчиков Young&&Yandex открывает регистрацию на Yan…
  6. Sep 16, 2026🐾 Яндексоиды рассказывают про свои пет-проекты: ktoml и diktat Продолжаем показывать виде…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →