Autoscaling Hid Our LLM Cost Regression (85% → 4% Cache Hit Rate)
Почему мы перенесли проектирование мощностей в CI и начали ограничивать эффективность кэширования префиксов
📌 Подробнее: https://medium.com/@nroan/autoscaling-hid-our-llm-cost-regression-85-4-cache-hit-rate-b4beab5df240
MemOps 🤨
Post #7233
1.64K