Ollama vs vLLM vs SGLang. Uchchalasi ham open model'larni ishga tushiradi, lekin har biri boshqa ish uchun:
— Ollama: bitta user, bitta mashina. Laptop/Mac'da prototip qilish uchun. Anthropic API formatini ham tushunadi, ya'ni Claude Code'ni local model bilan ishlatsa bo'ladi
— vLLM: ko'p user, har xil prompt'lar. Continuous batching + PagedAttention
— SGLang: agent'lar, RAG, uzun chat'lar. Umumiy prefix'larni qayta ishlatadi (RadixAttention)
Bonus tip: system prompt va tool'larni har safar bir xil qoldiring, o'zgaradigan qismni oxiriga qo'ying. Shunda prefix cache ishlaydi.
Sizda local model'lar qaysi birida ishlaydi?
Manba: https://lnkd.in/p/dfJYjuK9
Post #1738
265