Prompt caching
В любом нормальном LLM API есть возможность закэшить какой нибудь текст и затем подтянуть по хэшу или как нибудь ещё. Как работает и почему выгодно читайте ниже:
https://sankalp.bearblog.dev/how-prompt-caching-works/
Post #1812
187
Forwarded from Love. Death. Transformers.
sankalp's blog How prompt caching works - Paged Attention and Automatic Prefix Caching plus practical tips A deep dive into prompt caching - practical tips to improve cache hits and how vLLM's paged attention enables KV-cache reuse across requests via automatic prefix-caching