Qwen-AgentWorld обошёл Claude Opus и GPT-5.4 на новом агентном бенчмарке.
Qwen выпустили open-weight модели, которые симулируют реальные среды для агентов: web, terminal, coding, search, OS и Android.
Главное:
• 397B набрала 58.71 и обошла Opus 4.8 / GPT-5.4
• 35B MoE обошла Sonnet 4.6
• сильный прирост в coding, web и terminal задачах
• веса уже доступны на Hugging Face
Paper: https://arxiv.org/abs/2606.24597
Blog: https://qwen.ai/blog?id=qwen-agentworld
GitHub: https://github.com/QwenLM/Qwen-AgentWorld
HuggingFace: https://huggingface.co/collections/Qwen/qwen-agentworld
ModelScope: https://modelscope.cn/collections/Qwen/Qwen-AgentWorld
Post #10391
22.9K

- 🔥 105
- 🎉 70
- 👍 25
- 👏 13
- ❤ 8
- 🤣 5
- 👀 5
- 🤔 1