AirLLM — open-source проект, который позволяет запускать модели размером до 70B на одной GPU, не загружая их целиком в VRAM.
Как это работает:
— Модель разбивается на отдельные слои;
— Слои хранятся на диске;
— Во время инференса они загружаются по очереди;
— После вычислений память освобождается для следующего слоя.
⛓️ Ссылка на GitHub
tags: #полезное
➡ DevOps Community | Чат
