یک بنچمارک جدید از OpenAI برای ارزیابی توانایی مدلهای هوش مصنوعی در گفتوگوهای سلامت روان نشان میدهد برخی مدلهای پیشرفته توانستهاند در امتیازدهی استانداردشده، بالاتر از پاسخهای نوشتهشده توسط متخصصان انسانی قرار بگیرند. در این ارزیابی، GPT-6 Astra امتیاز ۵۷٫۳ و Claude Opus 5.5 امتیاز ۵۲٫۴ کسب کردند، در حالی که پاسخهای متخصصان سلامت روان امتیاز ۳۸٫۵ گرفتند.
اما دلیل این اختلاف فقط «بهتر بودن AI» نیست؛ پژوهشگران اشاره میکنند که متخصصان معمولاً در تعامل واقعی کوتاهتر پاسخ میدهند و بیشتر با سؤالهای باز یا جملات مختصر پیش میروند، در حالی که مدلهای هوش مصنوعی تمایل دارند پاسخهای طولانیتر و ساختاریافتهتری ارائه کنند که معیارهای بیشتری از آزمون را پوشش میدهد. این نتایج نشان میدهد AI میتواند ابزار قدرتمندی برای پشتیبانی سلامت روان باشد، اما این آزمون بهتنهایی جایگزینی برای رابطه درمانی واقعی را ثابت نمیکند.
✅ بنچمارک HealthBench-Psych برای ارزیابی پاسخهای هوش مصنوعی در سناریوهای سلامت روان طراحی شده است.
✅ GPT-6 Astra: امتیاز ۵۷٫۳
✅ GPT-6 Sol: امتیاز ۵۳٫۹
✅ Claude Opus 5.5: امتیاز ۵۲٫۴
✅ پاسخ متخصصان سلامت روان: امتیاز ۳۸٫۵
✅ معیار ارزیابی شامل مواردی مانند همدلی، ساختار پاسخ، پوشش نکات مهم و رعایت دستورالعملها بوده است.
✅ امتیاز بالاتر در یک بنچمارک متنی، به معنی عملکرد بهتر در تمام جنبههای درمان روانشناختی نیست.
🔗 منبع: arxiv
🔹 تلگرام . یوتیوب . توییتر . لینکدین
هوشمصنوعی در پژوهش، بروزترین ارائهدهنده اخبار هوشمصنوعی
