Все о машинном обучении
админ - @workakkk
@data_analysis_ml - анализ даннных
@ai_machinelearning_big_data - Machine learning
@itchannels_telegram -лучшие ит-каналы
@pythonl - Python
@pythonlbooks- python 📚
@datascienceiot - 📚
РКН: clck.ru/3FmrUw
Post #3524
2.07K

Дообучить 8B-модель теперь можно локально даже на ноутбучной GPU с 4 ГБ VRAM.
Soup держит замороженные веса модели в оперативной памяти и по очереди загружает на GPU только один слой декодера.
За счёт этого пиковое потребление видеопамяти остаётся ниже 4 ГБ.
Заявленные результаты на RTX 3050:
- 3,32 ГБ VRAM в пике
- до 119,6 токена/с
- результат побитово совпадает с обычным запуском
- вся настройка через один YAML-файл
Идея простая: вместо попытки целиком уместить 8B-модель в видеопамять слои последовательно передаются между RAM и GPU.
https://github.com/MakazhanAlpamys/Soup
Soup держит замороженные веса модели в оперативной памяти и по очереди загружает на GPU только один слой декодера.
За счёт этого пиковое потребление видеопамяти остаётся ниже 4 ГБ.
Заявленные результаты на RTX 3050:
- 3,32 ГБ VRAM в пике
- до 119,6 токена/с
- результат побитово совпадает с обычным запуском
- вся настройка через один YAML-файл
Идея простая: вместо попытки целиком уместить 8B-модель в видеопамять слои последовательно передаются между RAM и GPU.
https://github.com/MakazhanAlpamys/Soup
- 🔥 10
- ❤ 6
- 👍 4
















