TGViewer
هوش مصنوعی و علم داده به فارسی هوش مصنوعی و علم داده به فارسی @dataplusscience · 6.06K subscribers
Post #3433 257
‏🚀 سنجش قدرت استدلال در دنیای متغیر با EvolveScaler

‏تیم Tencent Hunyuan با معرفی بنچمارک EvolveScaler، چالش جدیدی برای مدل‌های زبانی بزرگ ایجاد کرده است. برخلاف تست‌های سنتی که صرفاً بر استخراج اطلاعات از متن متمرکز هستند، این ابزار توانایی مدل در «بازسازی وضعیت جهان» پس از تغییرات متوالی را می‌سنجد.

‏در این سناریوها، اطلاعات به‌صورت پویا اصلاح یا لغو می‌شوند و مدل باید بتواند با مدل‌سازی منطق رویدادها، نتایج تغییرات را به‌درستی تحلیل کند. نتایج نشان می‌دهد حتی مدل‌های پیشرو نیز در سطوح دشوار با افت عملکرد شدید مواجه می‌شوند.

‏از مهم‌ترین ویژگی‌های این بنچمارک:
‏- استفاده از ماشین وضعیت برای کنترل منطق رویدادها
‏- بررسی بیش از ۱۰۰ سناریو با تغییرات زنجیره‌ای
‏- ارزیابی دقیق توانایی مدل در محاسبات ضدواقعی (Counterfactual)

‏برای جزئیات بیشتر و دسترسی به نتایج مدل‌ها، مقاله این پروژه را مطالعه کنید.

بنچمارک EvolveScaler؛ چالش جدید Tencent برای سنجش استدلال پویا در مدل‌های زبانی

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
More from @dataplusscience
  1. Oct 2, 2026‏🛠 عرضه ابزار متن‌باز MCP برای سرویس ترب ‏ابزار جدیدی برای تعامل با سرویس «ترب» ب…
  2. Oct 2, 2026‏🤖 معرفی مدل‌های Intern-Decision برای تصمیم‌گیری ساختاریافته ‏خانواده مدل‌های Int…
  3. Oct 2, 2026‏🤖 شکستن کد ۲۱۷ ساله ناپلئون با GPT-6 Astra ‏کارتر چرچ با استفاده از مدل GPT-6 As…
  4. Oct 2, 2026‏🧠 مدل‌های زبانی با قابلیت مدیریت مستقیم حافظه ‏محققان متا در مدل‌های جدیدی با عن…
  5. Oct 2, 2026‏📉 کاهش محدودیت‌های GPT-6 Pro و هدیه ۲۵۰۰ دلاری OpenAI به کاربران ‏شرکت OpenAI تغ…
  6. Oct 2, 2026‏🌐 شناسایی کمپین استخراج غیرمجاز از مدل‌های OpenAI ‏شرکت OpenAI در بررسی‌های اخیر…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →