Карлос Галарса выложил slotstream, инструмент на Swift для Qwen3.8-Flash-Next. Модель устроена как mixture of experts: 512 экспертов на слой, активны 10 на токен, поэтому в память грузятся только нужные, через
pread в фиксированный пул слотов. Постоянно в памяти 3,8 ГБ, процесс занимает около 33 ГБ, генерация примерно 12 токенов в секунду на M5 Pro.цена: обработка промпта на 8000 токенов около 39 секунд, на 32 000 около трёх минут, контекст ограничен 32 768. Только Apple Silicon, macOS 14 и 110 ГБ свободного места; API совместим с Ollama и OpenAI. Почему обычный
mmap не сработал, на сайте.
