AirLLM - запуск гигантских LLM моделей на домашней видеокарте!Библиотека ломает барьеры доступности ИИ и позволяет запускать тяжелые модели вроде
Llama 3 70B на GPU всего с 4 ГБ VRAM, а огромную DeepSeek-V3 (671B) - на 12 ГБ. При этом не требуется проводить квантование, дистилляцию или обрезку весов. В чем секрет?
Утилита декомпозирует модель и загружает в видеопамять строго один слой за другим. В случае с
MoE-архитектурами библиотека стримит только тех экспертов, к которым идет запрос для генерации текущего токена. Нужный объем VRAM теперь зависит от размера одного слоя, а не от всей модели. Главные фичи:
- поддерживает
Llama 3/4, Qwen3, DeepSeek, Mistral и Gemma из коробки.- блочное сжатие ускоряет инференс до 3 раз без потери точности.
- весь код инференса пишется в одну строку через
AutoModel.- полноценно работает на
Linux и macOS (Apple Silicon). https://github.com/lyogavin/airllm
опубликовано в @gitgate
#ai #vram
