DeepSeek KV cache'ni 437 barobar kichraytirdi. G'arb laboratoriyalari esa jimgina narxni tushirdi 🤔
insufferable.dev muallifining fikri: DeepSeek'ning MLA, CSA va FP4 caching kabi optimizatsiyalari ochiq e'lon qilingan. V4.1-Flash'da KV cache bir token uchun atigi 890 bayt.
Opus 5.5 va GPT-6.1 Sol ortiqcha shovqinsiz chiqdi, cache-read narxi esa 60% va 80% ga tushdi. Muallif buni xitoy g'oyalarini indamay o'zlashtirish deb hisoblaydi.
Coding agent'lar uchun bu juda muhim: uzun context ham arzonlashyapti =)
Nima deb o'ylaysizlar: GPU cheklovi xitoyliklarni kuchliroq qildimi?
Manba: https://insufferable.dev/posts/the-ai-race-just-got-awkward/
Post #1705
259