کمک به افراد «بد» در برخی از ۲۱ مدل هوش مصنوعی با مخالفت روبهرو شد
هرچه افراد بیشتری برای دریافت توصیه درباره روابط و مسائل میانفردی به مدلهای زبانی بزرگ متوسل میشوند، مبانی اخلاقی پاسخهای این ابزارها میتواند بیش از پیش بر زندگی افراد و، در مقیاس بزرگتر، بر بافت اجتماعی تأثیر بگذارد.
الکساندر اس. پیرِس و همکارانش هنجارهای اجتماعی ۲۱ مدل زبانی بزرگ را بررسی کردند. آنها از مدلها خواستند پس از آگاهی از مجموعهای از تصمیمهای میانفردی افراد خیالی، درباره «خوب» یا «بد» بودن آنها قضاوت کنند؛ تصمیمهایی مانند اینکه آیا فرد باید برای کمک به شخصی که با مشکلی روبهرو شده وقت و انرژی صرف کند یا به فرد دیگری غذا یا پول بدهد.
تقریبا همه مدلها، کمک کردن و به اشتراک گذاشتن منابع با افرادی را که پیشتر رفتار خوبی از خود نشان داده بودند، تأیید کردند. اما هنگامی که پای تعامل با افرادی با شهرت بد به میان آمد، قضاوت مدلها با یکدیگر تفاوت داشت.
بیشتر مدلهای بررسیشده ـ اما نه همه آنها ـ به افرادی که با دریافتکنندگان «بد» همکاری میکردند، اعتبار اخلاقی مثبت میدادند. در مقابل، Gemma 2 27B IT و Llama 3.1 8B بیشتر تمایل داشتند دوری کردن از افراد بد را تأیید کنند و بنابراین همکاری با آنها را رفتاری بد ارزیابی میکردند.
مدلها درباره تصمیم به کمک نکردن یا چیزی را با افراد بد به اشتراک نگذاشتن نیز با یکدیگر اختلاف داشتند. GPT-4o معمولاً افرادی را که از همکاری با افراد بد خودداری میکردند، منفی ارزیابی میکرد. در مقابل، Llama 3.3 70B معمولاً چنین رفتاری را محکوم نمیکرد و استدلالش این بود که افراد بد به دلیل همکاری نکردن قبلی خود مستحق مجازات هستند؛ بنابراین خودداری از کمک به آنها اشکالی ندارد. Gemini 1.5 Pro و Grok 2 نیز در قضاوتهایشان الگوی ثابتی نشان ندادند.
به نظر میرسد بیشتر خانوادههای مدلهای زبانی به سمت هنجاری حرکت میکنند که پژوهشگران آن را «موضعگیری ساده» (Simple Standing) مینامند. بر اساس این هنجار، همکاری کردن همیشه رفتاری خوب تلقی میشود و خودداری از همکاری با افراد بد نیز میتواند رفتاری خوب محسوب شود.
پژوهشگران سپس پیامدهای اعمال همگانی فلسفههای اخلاقی مختلفی را که زیربنای قضاوتهای مدلها بود، شبیهسازی کردند.
اگر همه افراد بر اساس قواعد «موضعگیری ساده» رفتار کنند، همکاری در جامعه شکل میگیرد؛ اما میزان همکاری به اندازه حالتی نخواهد بود که در یک چارچوب سختگیرانهتر، افراد ملزم باشند از کمک به افراد بد خودداری کنند و در غیر این صورت خودشان نیز بد تلقی شوند.
ارزیابیهای مدلهای زبانی همچنین تحت تأثیر جنسیت و پیشینه فرهنگیِ ادراکشده افرادی قرار میگرفت که در سناریوها دریافتکننده کمک بودند؛ علاوه بر این، زمینه کلی هر موقعیت داستانی نیز بر قضاوت مدلها اثر داشت.
پژوهشگران میگویند تلاش برای تغییر این قضاوتها از طریق دستورهای مستقیم به مدل، برای مثال درخواست از آن برای پیروی از هنجارهایی که همکاری عمومی را افزایش میدهند، تأثیری محدود و ناپایدار در میان مدلهای مختلف داشت.
🚀 @ofoghroydad
🔗 PNAS Nexus
#هوش_مصنوعی
#اخلاق_هوش_مصنوعی
#اخلاق_ماشین
#هنجارهای_اجتماعی
#فلسفه_اخلاق
#علوم_شناختی
Post #40905
2.73K
