TGViewer
Девадвокатская палата Девадвокатская палата @devadvocado · 333 subscribers
Post #254 74

Forwarded from Yandex for Backend

🎙 Как ускорить работу LLM — в подкасте «От инженера слышу»

Почему мощная видеокарта не гарантирует быстрый ответ нейросети? И как обслуживать больше запросов на том же железе, не заставляя пользователей ждать?
В первом выпуске разбираемся, что происходит между отправкой запроса и появлением ответа. А также объясняем, как устроен инференс больших языковых моделей и что помогает сделать его быстрее и дешевле.

💬 Что ещё обсуждаем:

🟢 Чем обработка контекста отличается от генерации токенов

🟢 Как KV-кеш, квантование и спекулятивное декодирование помогают выжать больше из GPU

🟢 Как обрабатывать большой запрос одного пользователя, не тормозя остальных

🟢 Почему удачная оптимизация может оказаться бесполезной для конкретной нагрузки

🟢 Когда стоит разрабатывать свою библиотеку инференса и какую часть работы уже можно доверить AI-агентам

🔊 Слушайте выпуск на ютубе и в VK Видео
А больше о работе с LLM и других инженерных задачах бэкенда — на конференции «Я про бэкенд»

🈁 Регистрируйтесь и приходите за подробностями и опытом коллег

Подписывайтесь:

💬 @Yandex4Backend
📹 @YandexforBackend
  • 🔥 2
  • 😎 1
More from @devadvocado
  1. Sep 25, 2026В вопросе придумывания названий я пробил стеклянный потолок докладов и придумал название ц…
  2. Sep 18, 2026Деврел в сезон конференций be like
  3. Sep 17, 2026❌ сделал заявку на доклад сам ✅ наорала Знаете мем про "оделся сам" и "наорала"? Он мне ча…
  4. Sep 17, 2026Астрологи объявили неделю постов про подготовку докладов (казалось бы при чем количество к…
  5. Sep 16, 2026Готовлюсь сейчас к выступлению на Yandex Scale с провокационной темой доклада - "Мониторин…
  6. Sep 11, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →