TGViewer
هوش مصنوعی و علم داده به فارسی هوش مصنوعی و علم داده به فارسی @dataplusscience · 6.06K subscribers
Post #3723 170
‏🧪 بنچمارک جدید برای سنجش توانایی اکتشاف هوش مصنوعی

‏محققان Tencent، دانشگاه فودان و چینهوا بنچمارک ExplorationBench را برای بررسی قدرت «کشف قوانین جدید» توسط مدل‌های هوش مصنوعی ارائه کرده‌اند. در این محیط، منطق معمول کار نمی‌کند و مدل باید با آزمایش و خطا، قواعد حاکم بر «جهان‌های بیگانه» را بیاموزد.

‏این بنچمارک از دو محیط اصلی تشکیل شده است:
‏* AlienCode: شامل ۳۱ قانون و ۷۰ تسک برای ارزیابی منطق عددی.
‏* AlienLogic: شامل ۲۴ قانون و ۷۰ تسک برای بررسی قواعد منطقی.

‏نتایج ارزیابی ۱۰ سیستم هوش مصنوعی نشان می‌دهد که توانایی استدلال بر اساس قوانین از پیش‌تعیین‌شده با توانایی کشف قوانین جدید متفاوت است. مهم‌ترین نکات این آزمایش:
‏* مدل‌ها در شروع بدون بازخورد، عملکردی حداکثر ۱۵.۷ درصدی دارند که پس از چهار مرحله تعامل با محیط، در AlienCode تا ۸۹ درصد بهبود می‌یابد.
‏* در مهم‌ترین موارد از ۱۰ سیستم، طراحی آزمایش‌های خودکار توسط مدل برای کشف محیط، موثرتر از تکیه بر اطلاعات پیش‌فرض بود.
‏* تفاوت فاحش عملکردی (از ۵.۷ تا ۷۹ درصد) در مدل‌های مختلف با بودجه یکسان مشاهده شده است.

🇮🇷 سایت | تلگرام
More from @dataplusscience
  1. Oct 2, 2026‏🤖 معرفی مدل‌های Intern-Decision برای تصمیم‌گیری ساختاریافته ‏خانواده مدل‌های Int…
  2. Oct 2, 2026‏🤖 شکستن کد ۲۱۷ ساله ناپلئون با GPT-6 Astra ‏کارتر چرچ با استفاده از مدل GPT-6 As…
  3. Oct 2, 2026‏🧠 مدل‌های زبانی با قابلیت مدیریت مستقیم حافظه ‏محققان متا در مدل‌های جدیدی با عن…
  4. Oct 2, 2026‏📉 کاهش محدودیت‌های GPT-6 Pro و هدیه ۲۵۰۰ دلاری OpenAI به کاربران ‏شرکت OpenAI تغ…
  5. Oct 2, 2026‏🌐 شناسایی کمپین استخراج غیرمجاز از مدل‌های OpenAI ‏شرکت OpenAI در بررسی‌های اخیر…
  6. Oct 2, 2026‏انتشار مدل‌های ترجمه Index-Translate توسط Bilibili ‏تیم Index LLM در پلتفرم Bilib…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →