Разбираем prefix cache и показываем, как он помогает экономить.
На первый взгляд LLM работает просто: отправили запрос, получили ответ, оплатили токены. Поэтому первая идея оптимизации обычно такая: сократить промпт. Логика понятна: меньше токенов в запросе, меньше счёт.
В реальных AI-агентах всё сложнее. Агент редко ограничивается одним запросом. Он может выполнять цепочку из 10, 20 или 50 шагов, и тогда важнее становится другой вопрос: может ли модель переиспользовать часть запроса, которую уже обработала раньше. За это отвечает prefix cache, то есть кэш начала промпта.
Из-за этого появляется неочевидный эффект: короткий промпт может стоить дороже длинного.
Как это пофиксить — уже в статье: https://v.thecode.media/t0byq
Журнал «Код» | Промокод Практикума | Новости мира IT и технологий
Post #11204
3.02K

- 👍 8
- 🔥 5
- ❤ 2