TGViewer
Хабр Хабр @habr_com · 133K subscribers
Post #69510 18.9K
Как запустить Qwen3.8-Flash-Next 125B на 6 ГБ VRAM

Полный checkpoint Qwen3.8-Flash-Next в bf16 занимает около 360 ГБ на диске. Одна только вспомогательная n-gram таблица внутри модели весит 102 ГБ. По всем прикидкам такое должно требовать серверного железа или облака. А запустили её на обычной RTX 4090 с пиковым расходом VRAM 5,95 ГБ, без квантизации и дистилляции.

Причём это не урезанная версия ради демо. Полный checkpoint, native vision, контекст на 262K токенов, по собственным бенчмаркам Qwen конкурирует с закрытыми frontier-моделями в коде и работе с агентами. Фокус в том, что VRAM перестаёт быть узким местом, а нагрузка уходит совсем в другое место.
  • 😁 36
  • 🤡 23
  • 😭 11
  • ❤ 6
  • 🔥 6
  • 🤔 3
  • 🙏 3
  • 👍 2
  • 👏 2
  • 😱 2
More from @habr_com
  1. Sep 20, 2026Переделка радиоприемника «Электроника 26-01» Советских бытовых приёмников с синтезатором ч…
  2. Sep 20, 2026На чём советские гики учились программировать? Часть вторая В 1984 году аспирантам химфака…
  3. Sep 20, 2026И снова о том, из чего состоит протон Из школьной картинки протон это три кварка, и на низ…
  4. Sep 19, 2026Грязные игры Команда бывших нефтяников решила оставить след в индустрии и собрала топ-даун…
  5. Sep 19, 2026[ХАБРААРХИВ] «Оставайтесь голодными, оставайтесь безрассудными»: анализ речи Стива Джобса…
  6. Sep 19, 2026Есть советы, которые помогают строить карьеру. А есть советы, после которых помогает тольк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →