📌 Сайзинг RAM и vCPU для локальной языковой модели: считаем стартовый размер VM
Сайзинг RAM и vCPU для локальной языковой модели начинается с конкретных весов и профиля запросов. Исходные требования self-hosted LLM включают длину входа и ответа, конкурентность, рантайм и схему offload. Расчёт по размеру весов и формуле KV-кэша даёт стартовую конфигурацию, а прогретый тест показывает реальное потребление памяти и точку, где CPU перестаёт помогать.
Сколько RAM нужно квантованной модели?
RAM должна вмещать веса, KV-кэш, рабочие буферы рантайма и запас ОС. Основой служит размер файлов квантованной модели, а число параметров даёт лишь предварительную оценку. Итог подтверждают…
🔗 Источник: habr.com
#sysadmin #server #security #ai
📲 Подписывайся на канал 👉 @PRO100ITru
Post #634
36
