TGViewer
ml phys ml phys @mlphys · 2.89K subscribers
Post #274 1.86K
Я очень жду NVIDIA Rubin.

Это следующее поколение GPU после Blackwell, и там главный апгрейд для LLM - не сколько compute, а скорость памяти.

Сейчас decode-инференс часто упирается в HBM bandwidth: на каждый новый токен надо снова читать веса модели из памяти. У Rubin заявлено около 22 TB/s на GPU против 3.35 TB/s у H100 и ~8 TB/s у B200.

То есть для memory-bound inference это может быть около 7× к H100.

Для обучения тоже большой скачок: NVIDIA обещает до 4× меньше GPU для MoE training vs Blackwell.

Плюс CMX - по сути SSD прямо на видеокарте с быстрым доступом для KV-cache/long context. Если это нормально заработает, LLM смогут стать быстрее, больше или дешевле в инференсе (или всё вместе) уже в этом году
  • 🔥 16
  • ❤ 6
  • 👍 2
More from @mlphys
  1. Sep 20, 2026Дайте астре почилить хотя бы в воскресенье
  2. Sep 16, 2026https://mimo.xiaomi.com/rl/ Риал тайм дашборд трейнинга новой модели сиаоми
  3. Sep 10, 2026Изи
  4. Sep 8, 2026Очередной benchmark забенчмаксили , причем всего с 14 до 28 процентов, почему все так хайп…
  5. Sep 3, 2026Agi is here?
  6. Sep 1, 2026Post #343
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →