TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 278K subscribers
Post #10391 22.9K
Qwen-AgentWorld обошёл Claude Opus и GPT-5.4 на новом агентном бенчмарке.

Qwen выпустили open-weight модели, которые симулируют реальные среды для агентов: web, terminal, coding, search, OS и Android.

Главное:

• 397B набрала 58.71 и обошла Opus 4.8 / GPT-5.4
• 35B MoE обошла Sonnet 4.6
• сильный прирост в coding, web и terminal задачах
• веса уже доступны на Hugging Face

Paper: https://arxiv.org/abs/2606.24597
Blog: https://qwen.ai/blog?id=qwen-agentworld
GitHub: https://github.com/QwenLM/Qwen-AgentWorld
HuggingFace: https://huggingface.co/collections/Qwen/qwen-agentworld
ModelScope: https://modelscope.cn/collections/Qwen/Qwen-AgentWorld
  • 🔥 105
  • 🎉 70
  • 👍 25
  • 👏 13
  • ❤ 8
  • 🤣 5
  • 👀 5
  • 🤔 1
More from @ai_machinelearning_big_data
  1. Oct 3, 2026✔️ Anthropic открыла моды для Claude Code Моды – небольшие функции на TypeScript, меняющие…
  2. Oct 3, 2026⚡️ OpenAI обнулила лимиты платных аккаунтов ChatGPT Главный по ресетам в OpenAI сообщил, ч…
  3. Oct 2, 2026⚡️ Одна и та же модель набирает 62% в одном агентном харнессе и 33% в другом. Hugging Face…
  4. Oct 2, 2026✔️ OpenAI заблокировала атаку дистилляции скрытых CoT своих моделей Компания пресекла камп…
  5. Oct 2, 2026🌟 Cloudflare выпустила открытые модели решений Clef Обе модели, Clef и Clef-flash, вышли…
  6. Oct 2, 2026✔️ ВКонтакте научила Ленту отличать интерес к контенту от намерения купить Инженеры AI VK…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →