TGViewer
Инструменты программиста Инструменты программиста @prog_tools · 12.9K subscribers
Post #2929 1.27K
slotstream: локальный сервер для MoE-модели, которая не влезает в память вашего Mac

Инструмент на Swift запускает Qwen3.8-Flash-Next на 125 млрд параметров на Mac с 48 ГБ: веса лежат на SSD (105 ГБ), а в память подгружаются только нужные для текущего токена эксперты, через pread в фиксированный пул слотов. Наружу торчит HTTP API, совместимый с Ollama и OpenAI.

🔘 постоянно в памяти 3,8 ГБ, процесс около 33 ГБ, генерация около 12 токенов в секунду на M5 Pro;
🔘 промпт 8000 токенов около 39 секунд, 32 000 около трёх минут, контекст до 32 768;
🔘 требования: Apple Silicon, macOS 14, около 110 ГБ на диске; MIT;
🔘 работают curl, Open WebUI и OpenAI SDK; в slotstream 0.2.0 Ollama CLI пока не подключался.

Против Ollama и LM Studio: те дают модели, которые целиком помещаются в память, и быстрый prefill; slotstream даёт модель на класс больше ценой минут ожидания на длинном промпте. Linux и дискретных GPU нет и не планируется. Почему mmap здесь не работает, на сайте.

@prog_tools
  • 🤣 1
More from @prog_tools
  1. Sep 20, 2026Как переходить между каталогами с zoxide zoxide запоминает, какие каталоги вы открываете ч…
  2. Sep 20, 2026Как искать по коду с ripgrep с учётом .gitignore ripgrep (rg) рекурсивно ищет строки по ре…
  3. Sep 19, 2026Три вещи, которые невозможно объяснить человеку, родившемуся после 2005-го: зачем нужен бы…
  4. Sep 19, 2026Task: кроссплатформенный запуск задач проекта Task — быстрый инструмент сборки для повторя…
  5. Sep 19, 2026Как запускать и тестировать HTTP-запросы с Hurl Hurl — командная утилита для HTTP-запросов…
  6. Sep 18, 2026Tokei считает строки кода и отделяет их от комментариев Tokei — утилита командной строки д…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →