TGViewer
افــــــق رویـــــداد افــــــق رویـــــداد @ofoghroydad · 16.5K subscribers
Post #40905 2.73K
کمک به افراد «بد» در برخی از ۲۱ مدل هوش مصنوعی با مخالفت روبه‌رو شد

هرچه افراد بیشتری برای دریافت توصیه درباره روابط و مسائل میان‌فردی به مدل‌های زبانی بزرگ متوسل می‌شوند، مبانی اخلاقی پاسخ‌های این ابزارها می‌تواند بیش از پیش بر زندگی افراد و، در مقیاس بزرگ‌تر، بر بافت اجتماعی تأثیر بگذارد.

الکساندر اس. پیرِس و همکارانش هنجارهای اجتماعی ۲۱ مدل زبانی بزرگ را بررسی کردند. آنها از مدل‌ها خواستند پس از آگاهی از مجموعه‌ای از تصمیم‌های میان‌فردی افراد خیالی، درباره «خوب» یا «بد» بودن آنها قضاوت کنند؛ تصمیم‌هایی مانند اینکه آیا فرد باید برای کمک به شخصی که با مشکلی روبه‌رو شده وقت و انرژی صرف کند یا به فرد دیگری غذا یا پول بدهد.


تقریبا همه مدل‌ها، کمک کردن و به اشتراک گذاشتن منابع با افرادی را که پیش‌تر رفتار خوبی از خود نشان داده بودند، تأیید کردند. اما هنگامی که پای تعامل با افرادی با شهرت بد به میان آمد، قضاوت مدل‌ها با یکدیگر تفاوت داشت.

بیشتر مدل‌های بررسی‌شده ـ اما نه همه آنها ـ به افرادی که با دریافت‌کنندگان «بد» همکاری می‌کردند، اعتبار اخلاقی مثبت می‌دادند. در مقابل، Gemma 2 27B IT و Llama 3.1 8B بیشتر تمایل داشتند دوری کردن از افراد بد را تأیید کنند و بنابراین همکاری با آنها را رفتاری بد ارزیابی می‌کردند.

مدل‌ها درباره تصمیم به کمک نکردن یا چیزی را با افراد بد به اشتراک نگذاشتن نیز با یکدیگر اختلاف داشتند. GPT-4o معمولاً افرادی را که از همکاری با افراد بد خودداری می‌کردند، منفی ارزیابی می‌کرد. در مقابل، Llama 3.3 70B معمولاً چنین رفتاری را محکوم نمی‌کرد و استدلالش این بود که افراد بد به دلیل همکاری نکردن قبلی خود مستحق مجازات هستند؛ بنابراین خودداری از کمک به آنها اشکالی ندارد. Gemini 1.5 Pro و Grok 2 نیز در قضاوت‌هایشان الگوی ثابتی نشان ندادند.

به نظر می‌رسد بیشتر خانواده‌های مدل‌های زبانی به سمت هنجاری حرکت می‌کنند که پژوهشگران آن را «موضع‌گیری ساده» (Simple Standing) می‌نامند. بر اساس این هنجار، همکاری کردن همیشه رفتاری خوب تلقی می‌شود و خودداری از همکاری با افراد بد نیز می‌تواند رفتاری خوب محسوب شود.

پژوهشگران سپس پیامدهای اعمال همگانی فلسفه‌های اخلاقی مختلفی را که زیربنای قضاوت‌های مدل‌ها بود، شبیه‌سازی کردند.
اگر همه افراد بر اساس قواعد «موضع‌گیری ساده» رفتار کنند، همکاری در جامعه شکل می‌گیرد؛ اما میزان همکاری به اندازه حالتی نخواهد بود که در یک چارچوب سخت‌گیرانه‌تر، افراد ملزم باشند از کمک به افراد بد خودداری کنند و در غیر این صورت خودشان نیز بد تلقی شوند.

ارزیابی‌های مدل‌های زبانی همچنین تحت تأثیر جنسیت و پیشینه فرهنگیِ ادراک‌شده افرادی قرار می‌گرفت که در سناریوها دریافت‌کننده کمک بودند؛ علاوه بر این، زمینه کلی هر موقعیت داستانی نیز بر قضاوت مدل‌ها اثر داشت.

پژوهشگران می‌گویند تلاش برای تغییر این قضاوت‌ها از طریق دستورهای مستقیم به مدل، برای مثال درخواست از آن برای پیروی از هنجارهایی که همکاری عمومی را افزایش می‌دهند، تأثیری محدود و ناپایدار در میان مدل‌های مختلف داشت.

🚀 @ofoghroydad

🔗 PNAS Nexus

#هوش_مصنوعی
#اخلاق_هوش_مصنوعی
#اخلاق_ماشین
#هنجارهای_اجتماعی
#فلسفه_اخلاق
#علوم_شناختی
More from @ofoghroydad
  1. Oct 3, 2026روابط عاطفی انسان و هوش مصنوعی؛ آیا واقعا می‌توان از «دلبستگی» سخن گفت؟ این گزارش به بررسی…
  2. Oct 3, 2026🧠خاطرات چگونه در مغز ذخیره می‌شوند؟ هر خاطره‌ای که در ذهن داریم، حاصل تغییراتی واقعی در ش…
  3. Oct 3, 2026اگر گرانش واقعا ماهیتی هولوگرافیک داشته باشد، آیا آنچه ما فضا و جهان سه‌بعدی می‌نامیم، بنی…
  4. Oct 1, 2026چطور این ترکیب‌ها به ذهنتون میرسه
  5. Oct 1, 2026با این شرح پخش شده: تلاش برای انجام عملیات انتحاری در محل نماز کعبه، در مسجدالحرام، مکه، ع…
  6. Oct 1, 2026آیا مردان دارک برای زنان جذاب‌ ترند؟ گاهی در پژوهش‌های روان‌شناسی اجتماعی با یافته‌ای مواج…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →