DevOps-инструмент недели: AirLLM
Для локального запуска больших моделей вам не нужен мощный GPU.
AirLLM — это open-source инструмент, который позволяет запускать крупные модели на одной видеокарте, не загружая всю модель в VRAM целиком.
Он разбивает модель на слои и во время инференса подгружает их по одному.
Вот как это работает 👇
- При первом запуске AirLLM скачивает полную модель, разбивает её на отдельные шарды по слоям и сохраняет их на локальном диске.
- Когда вы отправляете запрос, модель начинает загружаться в VRAM послойно.
- Сначала из диска в VRAM видеокарты загружается первый слой, выполняется его обработка, затем память освобождается и загружается следующий слой.
- Этот процесс повторяется для каждого слоя. После обработки всех слоёв AirLLM возвращает ответ на ваш запрос.
Благодаря такому подходу даже GPU с 4 ГБ видеопамяти способен запускать модель размером 70B параметров.
Начать можно здесь: AirLLM GitHub Repository
👉 DevOps Portal
Post #1911
3.69K

- 👍 15
- ❤ 3