#полезное
😐 Самый быстрый движок для сервинга LLM уже тут — и он open-source
LMCache — новый движок, созданный для:
🟠 мгновенного time-to-first-token;
🟠 ыыше throughput даже при длинных контекстах;
🟠 7× быстрее доступа к KV-кешам и поддержка 100× большего объёма кеша по сравнению с vLLM;
🟠 и всё это — полностью open-source.
Если вы работаете с LLM в продакшне, LMCache может стать настоящим гейм-чейнджером для latency-чувствительных приложений.
Репозиторий
👉Новости 👉База вопросов
Post #390
138
