🎉 Маленькая LLM может тратить больше времени на загрузку, чем на ответ.
Google изучила запуск квантованных моделей от 270 млн до 3,8 млрд параметров на Cloud Run с CPU. При «холодном старте» 55–70% задержки приходилось на загрузку модели: прежде чем генерировать токены, нужно перенести её веса в память.
Нашёлся и менее очевидный эффект Cloud Run: переход с 4 на 8 ГиБ памяти в тестируемой конфигурации давал вдвое больше vCPU и почти вдвое сокращал время инференса после загрузки модели.
Практический вывод для редких запросов к небольшой LLM: оптимизировать стоит весь путь до ответа — загрузку весов, конфигурацию инстанса и только потом генерацию.
https://research.google/pubs/cold-start-latency-of-quantized-small-language-models-on-serverless-cpu-infrastructure/
Post #3041
1.54K

- 👍 4
- ❤ 3
- 🆒 1