TGViewer
ChillHouse ChillHouse @chillhousetech · 6.63K subscribers
Post #1305 6.11K
Btw релизнули свой первый результат в рисерче.

Выкатили первые квантизованные версии моделей Qwen 3.5.

За счет совместной оптимизации квантизации и движка инференса нам удалось заметно обойти Unsloth/llama.cpp и MLX по ключевому компромиссу «качество vs скорость». На устройствах Apple от iPhone до мощных Mac модели выдают на 40–60% больше токенов в секунду без потери качества.

Пост

hf collection
Mirai Labs Mirai Quantization: 40-60% Faster Local LLMs Mirai-M (4-bit) and Mirai-L (8-bit): a co-designed quantization and inference stack with 40-60% more tokens per second than llama.cpp and MLX at the same quality level.
  • 👍 74
  • 🔥 54
  • ❤ 18
  • ⚡ 2
  • ❤‍🔥 1
  • 🤔 1
More from @chillhousetech
  1. Sep 18, 2026На тему приложений и AI бума. Вообщем приложений много, но ими никто не пользуется. Персон…
  2. Sep 15, 2026На тему контроля за AI
  3. Sep 14, 2026У меня ко всем этим лабам и компаниям, которые разгоняют тему AI до небес есть один вопрос…
  4. Sep 12, 2026Новое эссе Дарио главы Антропика. Главная мысль в скриншоте. Остальное полезно прочесть. Д…
  5. Sep 10, 2026Еще мемов захотелось покидать. OpenAI стопнули новые подписки на 200 баксовый план. A few…
  6. Sep 10, 2026Всем особо обеспокоенным напоминаю несколько деталей последних событий: 1/ взлом HuggingFa…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →