AirLLM способен последовательно генерировать токены Kimi K3, храня почти все 1,56 ТБ весов на диске и удерживая в GPU только текущие модули; на RTX 6000 Ada для короткого теста было измерено 3,72 ГБ VRAM при скорости около одного токена за 292 секунды.
Генерация ответа на 100 токенов заняла бы около 8,1 часа;
Post #2042
2.09K
Forwarded from Наиль Шакиров
- 😁 9
- 😱 4
- ❤ 2
- 🤷♂ 2