TGViewer
immers.cloud | Облако с GPU immers.cloud | Облако с GPU @immers_cloud · 944 subscribers
Post #1377 375
Сравнительный анализ инференса модели openai/gpt-oss-20 на RTX 4090 и H100 NVL

Что важно:
🟠 RTX 4090 достигает предела масштабирования пропускной способности на уровне ~15 RPS. Объема VRAM хватает для одновременного размещения не более двух контекстов максимальной длины (131k токенов) и при одновременной обработке более 200 запросов начинается вытеснение (preemption) данных из KV-кэша (фактически удаление).
Это приводит к необходимости повторного вычисления значений KV для вытесненного запроса с первого токена, что увеличивает показатели TTFT, ITL и E2E latency.

🟠 KV_OFFLOAD снижает негативный эффект вытеснения путем сохранения уже рассчитанных значений для вытесняемых запросов на хосте, но вносит дополнительные задержки из-за передачи данных между GPU и CPU.

🟠 H100 NVL не допускает вытеснения и обеспечивает линейное масштабирование пропускной способности (запросов / сек) с увеличением RPS благодаря четырехкратному преимуществу в объеме доступной памяти под KV-кэш и при этом обладает гораздо более мощными вычислительными возможностями.

▶️ Арендовать сервер с Н100 NVL

📬 Подписывайтесь на нас в МАХ
  • 👏 3
  • ⚡ 2
  • ❤ 1
  • 🔥 1
More from @immers_cloud
  1. Sep 13, 2026Поздравляем разработчиков с профессиональным праздником ❤️ Работа программиста — это не то…
  2. Sep 11, 2026GLM-5.3 — текстовая MoE-модель семейства GLM-5 от Z.ai с 753 млрд параметров (около 40 млр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →