AirLLM оптимизирует использование памяти для логического вывода, позволяя 70-миллиардным большим языковым моделям выполнять логический вывод на одной видеокарте с 4 ГБ памяти без квантования, дистилляции и усечения.
Теперь вы можете запустить 405-миллиардную Llama3.1 на 8 ГБ видеопамяти.
🐱 GitHub
Post #10883
11.6K

- ❤ 25
- 🤔 16