TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #3041 1.54K
🎉 Маленькая LLM может тратить больше времени на загрузку, чем на ответ.

Google изучила запуск квантованных моделей от 270 млн до 3,8 млрд параметров на Cloud Run с CPU. При «холодном старте» 55–70% задержки приходилось на загрузку модели: прежде чем генерировать токены, нужно перенести её веса в память.

Нашёлся и менее очевидный эффект Cloud Run: переход с 4 на 8 ГиБ памяти в тестируемой конфигурации давал вдвое больше vCPU и почти вдвое сокращал время инференса после загрузки модели.

Практический вывод для редких запросов к небольшой LLM: оптимизировать стоит весь путь до ответа — загрузку весов, конфигурацию инстанса и только потом генерацию.

https://research.google/pubs/cold-start-latency-of-quantized-small-language-models-on-serverless-cpu-infrastructure/
  • 👍 4
  • ❤ 3
  • 🆒 1
More from @machinelearning_interview
  1. Sep 24, 2026Размер – не главное? У небольшой AliceAI-Foundation-80B-A3B-Base от Яндекса уже появились…
  2. Sep 24, 2026⚡️ inclusionAI открыла две модели для генерации и редактирования дизайна Ming-Image-0.1-De…
  3. Sep 23, 2026⚡️ Агенты научились улучшать собственную обвязку RRSI оптимизирует не веса модели, а всю с…
  4. Sep 22, 2026Сразу три новых флагмана в гонке ИИ За несколько недель рынок получил GPT-6 Astra, Grok 4.…
  5. Sep 22, 2026🌟 Samsone: открытые аудиоязыковые модели для смартфонов Samsung опубликовали Samsone - се…
  6. Sep 22, 2026🚀 Claude Opus 5.5 — новый флагман Anthropic Anthropic обновила свою самую мощную модель.…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →