JANGQ-AI выложили
Hy3-JANG_2K-MTP — квантованную версию Tencent Hy3 для MLX / JANG-рантаймов.Что внутри:
• 295B параметров всего, около 21B активных на токен
• MoE-архитектура с 192 routed experts и top-8 маршрутизацией
• контекст до 262K токенов
• размер бандла около 98 GiB
• routed experts в среднем 2.33-bit
• сохранён MTP-head для speculative decoding
Главная фишка — это не просто «ужали модель». В бандле оставили native Multi-Token Prediction слой, чтобы совместимый рантайм мог использовать speculative decoding.
Но есть важный нюанс: stock
mlx-lm и обычный transformers это напрямую не поднимут. Нужен Hy3-aware MLX/JANG runtime, который понимает JANG mixed-affine layout, GQA KV cache, MoE-роутинг, <think> reasoning stream и Hunyuan-style tool calls.По ограничениям тоже честно: бенчмарков качества именно для этого пака пока нет, а ускорение от MTP не обещается как фиксированная цифра — оно зависит от acceptance rate и режима сэмплинга.
Короче, это интересный пак для тех, кто хочет гонять большой MoE на Apple Silicon и экспериментировать с MTP, но пока скорее для энтузиастов рантаймов, а не «скачал и запустил в любом UI».
HF: https://huggingface.co/JANGQ-AI/Hy3-JANG_2K-MTP
