TGViewer
Журнал «Код» Журнал «Код» @thecodemedia · 49.1K subscribers
Post #11204 3.02K
Разбираем prefix cache и показываем, как он помогает экономить.

На первый взгляд LLM работает просто: отправили запрос, получили ответ, оплатили токены. Поэтому первая идея оптимизации обычно такая: сократить промпт. Логика понятна: меньше токенов в запросе, меньше счёт.

В реальных AI-агентах всё сложнее. Агент редко ограничивается одним запросом. Он может выполнять цепочку из 10, 20 или 50 шагов, и тогда важнее становится другой вопрос: может ли модель переиспользовать часть запроса, которую уже обработала раньше. За это отвечает prefix cache, то есть кэш начала промпта.

Из-за этого появляется неочевидный эффект: короткий промпт может стоить дороже длинного.

Как это пофиксить — уже в статье: https://v.thecode.media/t0byq

Журнал «Код» | Промокод Практикума | Новости мира IT и технологий
  • 👍 8
  • 🔥 5
  • ❤ 2
More from @thecodemedia
  1. Oct 7, 2026Post #11562
  2. Oct 7, 2026Post #11561
  3. Oct 7, 2026Код, про нейросети сейчас пишут все, и мы в том числе. Но хочется писать про то, что реаль…
  4. Oct 6, 2026Разбираемся, как проходить system design: что спрашивать в начале, что рисовать, как счита…
  5. Oct 6, 2026🔑 Интересная задача на логику про ключи и пессимиста Есть три ключа, три замка и один пес…
  6. Oct 5, 2026ИИ в работу внедрили, а как работать с ним — не объяснили ¯\_(ツ)_/¯ 8 октября Яндекс Практ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →