🧪 بنچمارک جدید برای سنجش توانایی اکتشاف هوش مصنوعی
محققان Tencent، دانشگاه فودان و چینهوا بنچمارک ExplorationBench را برای بررسی قدرت «کشف قوانین جدید» توسط مدلهای هوش مصنوعی ارائه کردهاند. در این محیط، منطق معمول کار نمیکند و مدل باید با آزمایش و خطا، قواعد حاکم بر «جهانهای بیگانه» را بیاموزد.
این بنچمارک از دو محیط اصلی تشکیل شده است:
* AlienCode: شامل ۳۱ قانون و ۷۰ تسک برای ارزیابی منطق عددی.
* AlienLogic: شامل ۲۴ قانون و ۷۰ تسک برای بررسی قواعد منطقی.
نتایج ارزیابی ۱۰ سیستم هوش مصنوعی نشان میدهد که توانایی استدلال بر اساس قوانین از پیشتعیینشده با توانایی کشف قوانین جدید متفاوت است. مهمترین نکات این آزمایش:
* مدلها در شروع بدون بازخورد، عملکردی حداکثر ۱۵.۷ درصدی دارند که پس از چهار مرحله تعامل با محیط، در AlienCode تا ۸۹ درصد بهبود مییابد.
* در مهمترین موارد از ۱۰ سیستم، طراحی آزمایشهای خودکار توسط مدل برای کشف محیط، موثرتر از تکیه بر اطلاعات پیشفرض بود.
* تفاوت فاحش عملکردی (از ۵.۷ تا ۷۹ درصد) در مدلهای مختلف با بودجه یکسان مشاهده شده است.
🇮🇷 سایت | تلگرام
Post #3723
170

