🤖 ارزیابی هوش مصنوعی در محیط کار واقعی با ApprenticeBench
استارتاپ NeoCognition بهتازگی بنچمارک جدیدی به نام ApprenticeBench را معرفی کرده است که توانایی مدلهای هوش مصنوعی را در ایفای نقش یک کارمند واقعی بررسی میکند.
در این آزمون، عامل هوشمند در یک شرکت ساختوساز مجازی استخدام میشود تا وظایف حسابداری را انجام دهد. این بنچمارک برخلاف موارد سنتی، بر استفاده از رابط کاربری گرافیکی (GUI)، یادگیری مداوم در طول زمان و کار با اسناد آرشیوی تمرکز دارد.
مهمترین نکات این ارزیابی:
• عملکرد درخشان مدلهای پیشرفته: مدل Fable 5.1 با دقت ۷۲٪ و GPT-6 Astra با ۶۸٪ توانستند از میانگین عملکرد انسان (۵۱٪) پیشی بگیرند.
• چالش یادگیری طولانیمدت: بسیاری از مدلهای ضعیفتر مانند Kimi K3 نتوانستند از تاریخچه و یادداشتهای خود استفاده کنند و به مرور دچار افت عملکرد شدند.
• برتری در کار با GUI: برخلاف اکثر مدلها که در محیط رابط کاربری با افت شدید عملکرد مواجه میشوند، مدلهای برتر در این تست حتی در محیط GUI نتایج بهتری نسبت به API ثبت کردند.
ارزیابی توانایی هوش مصنوعی در محیط کار با بنچمارک ApprenticeBench
Post #3412
254


