TGViewer
Типичный программист Типичный программист @tproger · 78.3K subscribers
Post #14779 7.79K
Модель на 125 миллиардов параметров запустили на ноутбуке с 48 ГБ памяти

Веса Qwen3.8-Flash-Next занимают 105 ГБ на диске, и обычный загрузчик на MacBook с 48 ГБ уходил в подкачку и умирал до первого токена. Карлос Галарса написал slotstream: модель устроена как mixture of experts, на каждый токен нужны 10 экспертов из 512, поэтому инструмент держит в памяти фиксированный пул слотов и дочитывает нужных экспертов с SSD через pread.

Итог: 3,8 ГБ постоянно в памяти, около 33 ГБ на процесс, 12 токенов в секунду генерации. Плата за это: промпт на 8000 токенов обрабатывается 39 секунд, на 32 000 три минуты. Только Apple Silicon и macOS 14, API совместим с Ollama и OpenAI, так что Open WebUI подключается сразу.

Почему ленивый mmap тоже не спас и что проверить перед запуском, разобрали на сайте.
  • ❤ 19
  • 👍 9
  • 🔥 3
  • 👏 2
  • 🤔 2
  • 💯 2
  • ⚡ 1
  • 🤯 1
  • 🎉 1
  • 🕊 1
  • 😍 1
More from @tproger
  1. Sep 20, 2026Как повторное использование ReverseProxy ускорило прокси на Go в 3,8 раза Автор нагрузил с…
  2. Sep 20, 2026Мы вернулись из Суздаля с новым взглядом на магазин у дома Были на tech-туре MAGNIT TECH «…
  3. Sep 19, 2026Вопрос на разогрев: что из этого появилось раньше — ICQ, MySpace или Nokia 3310? Если заду…
  4. Sep 19, 2026Почему тип указателя не гарантирует безопасность памяти Указатель сохраняет тип, даже когд…
  5. Sep 19, 2026В Суздаль за DevOps Недавно мы съездили на «Без предела: Исходный код ритейла» от MAGNIT T…
  6. Sep 18, 2026Как Cloudflare освободила 100 ТБ памяти в DNS-кеше 1.1.1.1 Big Pineapple за сервисом 1.1.1…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →