TGViewer
immers.cloud | Облако с GPU immers.cloud | Облако с GPU @immers_cloud · 944 subscribers
Post #1287 582
Что влияет на расход VRAM?
👋 Во время инференса память GPU расходуется сразу на несколько задач: хранение весов, KV-кэш, временные активации, batch, CUDA Graphs, служебные буферы и внутренние механизмы inference-фреймворка. Итоговое потребление зависит не только от самой модели, но и от того, как именно она используется.

📌 Один и тот же LLM может без проблем работать с короткими запросами, но столкнуться с нехваткой памяти при длинном контексте, большом числе одновременных пользователей или высокой параллельной нагрузке.

▪️ Именно поэтому сервер подбирают не только по размеру модели. Для корректного расчёта важно учитывать рабочий сценарий, длину контекста, ожидаемую генерацию, batch size, max concurrency, особенности GPU и используемый inference-фреймворк.

📲 Подробнее — в слайдах.

➡️ В Immers Foundation Models можно изучить характеристики open-source моделей, посмотреть рекомендуемые требования к ресурсам и протестировать модель через публичный эндпоинт, если он доступен. Для production-задач можно развернуть приватный сервер с GPU и подобрать конфигурацию под свою нагрузку.
  • ❤ 3
  • 👍 1
  • 🔥 1
  • 🎉 1
More from @immers_cloud
  1. Sep 16, 2026Сравнительный анализ инференса модели openai/gpt-oss-20 на RTX 4090 и H100 NVL Что важно:…
  2. Sep 13, 2026Поздравляем разработчиков с профессиональным праздником ❤️ Работа программиста — это не то…
  3. Sep 11, 2026GLM-5.3 — текстовая MoE-модель семейства GLM-5 от Z.ai с 753 млрд параметров (около 40 млр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →