Tencent выложила Hy3
Это MoE-модель на 295B параметров, но активируется около 21B на токен. Контекст - до 256K.
В blind tests модель обходит GLM-5.1, при этом использует меньше активных параметров, чем модели, с которыми конкурирует.
295B MoE, 21B active, 256K context. И всё это на обычном GQA. Без sparse attention, без MLA.
Это значит, что эффективность пока не вытянута архитектурными трюками до предела. Там ещё остаётся запас.
Модель можно запускать через vLLM и SGLang, есть FP8-версия, лицензия - Apache 2.0.
https://huggingface.co/tencent/Hy3
@ai_machinelearning_big_data
Post #10480
21.3K

- 👍 51
- 🤓 46
- 🎉 10
- ❤ 6
- 🔥 6
- 👏 4
- 🤔 2