ExLlamaV3
[Репозиторий][Чекпоинты]
На этой неделе turboderp выпустил 3-ую версию своего фреймворка для инференса LLM.
На данный момент либа находится на стадии разработки:
📌 Есть куда расти в плане оптимизации (неоптимальная утилизация на Ampere GPU)
📌 AMD GPU (если у кого есть такие) не поддерживаются
📌 Планируют накатить интеграцию с FlashInfer
📌 На данный момент поддерживаются только Llama, Qwen, Gemma2, Mistral архитектуры.
Прошлая версия ExLlama в качестве метода квантизации брала GPTQ, но в этот раз за основу взяли тяжелую артиллерию среди низкобитных методов квантизации - адаптацию QTIP, тем самым гарантируя качество значительно лучше GGUF, особенно при экстремальном сжатии (в 2 и менее бит).
По перплексии качество выглядит и правда хорошо, интересно было бы оценить на других задачах.
Post #470
3.79K

- 🔥 11
- 👍 1