TGViewer
Представляешь, Представляешь, @your_tech · 8.73K subscribers
Post #10658 775
модель на 125 млрд параметров запустили на Mac с 48 ГБ памяти: веса весят 105 ГБ и подгружаются с SSD

Карлос Галарса выложил slotstream, инструмент на Swift для Qwen3.8-Flash-Next. Модель устроена как mixture of experts: 512 экспертов на слой, активны 10 на токен, поэтому в память грузятся только нужные, через pread в фиксированный пул слотов. Постоянно в памяти 3,8 ГБ, процесс занимает около 33 ГБ, генерация примерно 12 токенов в секунду на M5 Pro.

цена: обработка промпта на 8000 токенов около 39 секунд, на 32 000 около трёх минут, контекст ограничен 32 768. Только Apple Silicon, macOS 14 и 110 ГБ свободного места; API совместим с Ollama и OpenAI. Почему обычный mmap не сработал, на сайте.
  • 🤯 5
  • ⚡ 1
  • 👍 1
More from @your_tech
  1. Sep 20, 2026LiteLLM 1.103.0-rc.1 получил расширение для VS Code и управление MCP-сессиями Вышла предва…
  2. Sep 20, 2026Valhalla 3.9.0 ускорила сборку тайлов и добавила маршруты через пешеходные зоны Разработчи…
  3. Sep 20, 2026QwenCloud выпустила модель HappyOyster Adventure для создания интерактивных миров Модель h…
  4. Sep 20, 2026OpenAI выпустила Node SDK 7.20.0 с новыми средствами управления и безопасности OpenAI обно…
  5. Sep 20, 2026ClickHouse выпустила LTS-версию 26.8.8.8 Команда ClickHouse 19 сентября выпустила версию 2…
  6. Sep 20, 2026Microsoft Foundry получила стандартный канал связи между ИИ-агентами Microsoft выпустила A…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →