На датазавтраке рассказывал свое видение локального инференса:
"тяжелые" карты и прод, модели в полных весах - SGLang
5090 4090 и прод, кванты и маленькие модели - vLLM
не прод - для экспериментов с разными моделями - Ollama
Это все для linux и API
Если вы на своем маке запускаете, LM Studio наверное? Не использую мак
Есть еще llama.cpp (ollama поверх него) TensorRT-LLM (крутой, но руки нужны прямо из плеч) и еще, но в целом так картинку вижу.
@kertar1 перебирал варианты для домашнего инференса, может поправит меня
Post #2063
446
- 👍 3