Авторский канал по ВАЙБ КОДИНГУ
Ссылка для друзей: https://t.me/+ll3pbl442dNkZmYy
Cотрудничество: @devmangx
РКН: https://clck.ru/3RRVfk
Post #3013
10.4K
Кэширование промптов в больших языковых моделях: кейс о том, как Claude достигает 92% cache hit-rate
Каждый раз, когда ИИ-агент делает шаг, он отправляет всю историю диалога обратно в модель.
Туда входят системные инструкции, определения инструментов и контекст проекта, который уже обрабатывался три хода назад. Всё это заново читается, заново обрабатывается и заново тарифицируется на каждом шаге.
В долгоживущих агентных воркфлоу такие избыточные вычисления часто становятся самой дорогой строкой затрат во всей ИИ-инфраструктуре.
Системный промпт на 20 000 токенов при 50 шагах — это 1 миллион токенов избыточных вычислений, оплаченных по полной цене и не создающих новой ценности. И эта стоимость накапливается для каждого пользователя и каждой сессии.
Решение — кэширование промптов. Но чтобы использовать его эффективно, нужно понимать, что именно происходит под капотом. Вот разбор. ❤️
Каждый раз, когда ИИ-агент делает шаг, он отправляет всю историю диалога обратно в модель.
Туда входят системные инструкции, определения инструментов и контекст проекта, который уже обрабатывался три хода назад. Всё это заново читается, заново обрабатывается и заново тарифицируется на каждом шаге.
В долгоживущих агентных воркфлоу такие избыточные вычисления часто становятся самой дорогой строкой затрат во всей ИИ-инфраструктуре.
Системный промпт на 20 000 токенов при 50 шагах — это 1 миллион токенов избыточных вычислений, оплаченных по полной цене и не создающих новой ценности. И эта стоимость накапливается для каждого пользователя и каждой сессии.
Решение — кэширование промптов. Но чтобы использовать его эффективно, нужно понимать, что именно происходит под капотом. Вот разбор. ❤️






