TGViewer
هوش مصنوعی و علم داده به فارسی هوش مصنوعی و علم داده به فارسی @dataplusscience · 6.06K subscribers
Post #3412 254
‏🤖 ارزیابی هوش مصنوعی در محیط کار واقعی با ApprenticeBench

‏استارتاپ NeoCognition به‌تازگی بنچمارک جدیدی به نام ApprenticeBench را معرفی کرده است که توانایی مدل‌های هوش مصنوعی را در ایفای نقش یک کارمند واقعی بررسی می‌کند.

‏در این آزمون، عامل هوشمند در یک شرکت ساخت‌وساز مجازی استخدام می‌شود تا وظایف حسابداری را انجام دهد. این بنچمارک برخلاف موارد سنتی، بر استفاده از رابط کاربری گرافیکی (GUI)، یادگیری مداوم در طول زمان و کار با اسناد آرشیوی تمرکز دارد.

‏مهم‌ترین نکات این ارزیابی:
‏• عملکرد درخشان مدل‌های پیشرفته: مدل Fable 5.1 با دقت ۷۲٪ و GPT-6 Astra با ۶۸٪ توانستند از میانگین عملکرد انسان (۵۱٪) پیشی بگیرند.
‏• چالش یادگیری طولانی‌مدت: بسیاری از مدل‌های ضعیف‌تر مانند Kimi K3 نتوانستند از تاریخچه و یادداشت‌های خود استفاده کنند و به مرور دچار افت عملکرد شدند.
‏• برتری در کار با GUI: برخلاف اکثر مدل‌ها که در محیط رابط کاربری با افت شدید عملکرد مواجه می‌شوند، مدل‌های برتر در این تست حتی در محیط GUI نتایج بهتری نسبت به API ثبت کردند.

ارزیابی توانایی هوش مصنوعی در محیط کار با بنچمارک ApprenticeBench
More from @dataplusscience
  1. Oct 2, 2026‏🤖 انتشار مدل‌های تصمیم‌گیری Clef توسط Cloudflare ‏کلودفلر از مدل‌های وزن‌باز Cle…
  2. Oct 2, 2026‏🎨 عرضه مدل تصویرساز FLUX.1 توسط Black Forest Labs ‏شرکت Black Forest Labs مدل جد…
  3. Oct 2, 2026‏📊 انتشار مجموعه داده Ego-Exo4D-HM برای بازسازی حرکت انسان ‏دانشگاه تگزاس در آستی…
  4. Oct 2, 2026‏🧠 تأثیر ایجنت‌های هوش مصنوعی بر اقتصاد اشتراکی ‏تحقیقات استنفورد نشان می‌دهد حدو…
  5. Oct 2, 2026🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده 🗂 گزارش #131 | 📌 8 آیتم گزارش | 🧾…
  6. Oct 2, 2026‏🛠 عرضه ابزار متن‌باز MCP برای سرویس ترب ‏ابزار جدیدی برای تعامل با سرویس «ترب» ب…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →