TGViewer
ML&|Sec Feed ML&|Sec Feed @mlsecfeed · 1.38K subscribers
Post #1812 187

Forwarded from Love. Death. Transformers.

Prompt caching

В любом нормальном LLM API есть возможность закэшить какой нибудь текст и затем подтянуть по хэшу или как нибудь ещё. Как работает и почему выгодно читайте ниже:

https://sankalp.bearblog.dev/how-prompt-caching-works/
sankalp's blog How prompt caching works - Paged Attention and Automatic Prefix Caching plus practical tips A deep dive into prompt caching - practical tips to improve cache hits and how vLLM's paged attention enables KV-cache reuse across requests via automatic prefix-caching
More from @mlsecfeed
  1. Oct 10, 2026Когнитивные артефакты для поиска ИИ-малвари Для поиска ИИ-малвари традиционные индикаторы…
  2. Oct 10, 2026Mensarium — self-hosted обвязка для AI-агента: ставите Core на сервер или ноутбук, подключ…
  3. Oct 10, 2026Progressive Disclosure для MCP/API - экономия токенов в ~99% Я вчера писал про 12 итерацию…
  4. Oct 9, 2026Research-first-builder — заставьте вашего агента по программированию обосновать архитектур…
  5. Oct 9, 2026Post #2792
  6. Oct 7, 2026🔥 Первый день Форума «Цифровые решения» — работаем Мы представили два руководства по безо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →