🔖 Не вся инфраструктура для локальных LLM одинаково быстрая
Ollama отлично подходит для быстрого старта, но если нужна максимальная производительность, многие переходят на vLLM.
Автор собрал практически всё, что влияет на скорость инференса: выбор видеокарты, работу с VRAM, квантизацию, настройку llama.cpp, KV-кэш, MoE-модели и множество практических рекомендаций.
⛓️ Ссылка на GitHub
tags: #полезное
➡ Data Scientist | Чат
Post #975
687

- ❤ 2
- 👍 1
- 🔥 1