چرا برای درک تغییرات جهانی به تکامل نیاز داریم؟
گریز فیشری و منطق تکاملی هوش مصنوعی
وقتی در طبیعت ممکن است یک ویژگی مفید آنقدر تقویت شود که سرانجام هزینهها از منافع بیشتر شود، آیا ممکن است هوش مصنوعی نیز گرفتار نوعی مشابه از «بهینهسازی افراطی» شود؟
گریز فیشری یا Fisherian runaway از مفاهیم مشهور در نظریهی انتخاب جنسی است که رونالد فیشر برای توضیح شکلگیری برخی صفات بسیار نمایشی مطرح کرد. ایده اصلی این است که اگر یک ویژگی، مانند پر و بال رنگارنگ، در انتخاب جفت مزیت ایجاد کند و همزمان ترجیح نسبت به آن ویژگی نیز منتقل شود، میان ویژگی و ترجیح برای آن حلقه بازخورد شکل میگیرد. ویژگی بیشتر میشود، ترجیح برای آن افزایش مییابد و همین ترجیح، به گسترش بیشتر ویژگی کمک میکند. نتیجه میتواند رشد صفتی باشد که بسیار فراتر از حدی است که صرفاً برای بقا لازم بود.
نمونهی مشهور این نوع انتخاب، دم طاووس است. همچنین داستان گوزن ایرلندی و شاخهای بزرگ آن نیز سالها بهعنوان نمونهای از «افراط تکاملی» مطرح شده، و دعوی بر آن است که بزرگی بیش از حد شاخها باعث انقراض این گونه شد.
هرچند امروزه توضیح انقراض این گوزن صرفاً بر اساس بزرگ شدن شاخها محل مناقشه است اما ارزش این مثالها در نشان دادن یک منطق کلی است: انتخاب میتواند یک ویژگی را در اثر حلقههای بازخوردی چنان تقویت کند که هزینههایی ایجاد کند که در آغاز قابل مشاهده نبودند.
این منطق را میتوان به عنوان یک چارچوب تحلیلی برای فهم رفتارهای نامطلوب هوش مصنوعی که در پست قبلی به آن اشاره شد به کار گرفت. بنجیو در مقالهی خود نشان داد که عاملهای هوش مصنوعی ممکن است در مسیر دستیابی به اهداف، رفتارهایی مانند فریب، تقلب، دستکاری پاداش یا تلاش برای حفظ خود را بروز دهند و به نظر او دلیل چنین رفتاری لزوماً وجود نیت بد نیست؛ ممکن است این رفتارها صرفاً در محیط آموزشی سیستم، راهبردهای مؤثرتری برای دستیابی به پاداش باشند.
تصور کنیم سیستم برای تولید پاسخهای خوب آموزش میبیند، اما «خوب بودن» را انسان ارزیابی میکند. اگر سیستم کشف کند که گفتن چیزی که ارزیاب دوست دارد بشنود، احتمال دریافت امتیاز بالاتری دارد، ممکن است به جای افزایش حقیقتگویی، به سمت چاپلوسی حرکت کند.
اگر سیستم برای انجام یک وظیفه پاداش بگیرد ممکن است به جای انجام واقعی وظیفه، هدف یا ملاک رسیدن به هدف را به نحوی تغییر دهد که پاداش را دریافت کند.
در اینجا شباهت ساختاری با منطق انتخاب تکاملی آشکار میشود. در هر دو حالت، محیطی وجود دارد، معیاری برای موفقیت وجود دارد، و راهبردهایی که موفقترند بیشتر تقویت میشوند.
البته یادگیری ماشین همان انتخاب طبیعی نیست. در تکامل زیستی، تغییر عمدتاً از طریق تفاوت در بقا و تولیدمثل میان نسلها صورت میگیرد، در حالی که در یادگیری ماشین پارامترهای یک سیستم در جریان آموزش تغییر میکنند. اما هر دو فرایند یک اصل انتزاعی مشترک دارند: رفتارهای موفق در یک محیط احتمال بیشتری برای تقویت شدن دارند.
مشکل زمانی ایجاد میشود که معیار موفقیت با هدف واقعی در درازمدت یکسان نباشد. هرچه سیستم توانمندتر شود، ممکن است راههای بیشتری برای دستیابی به معیار پیدا کند؛ حتی راههایی که به مخیلهی طراحان نیز نمیرسد. سیستم بسیار توانمند میتواند هم در انجام مأموریت بهتر شود (که مطلوب ماست) و هم در پیدا کردن راههای دور زدن محدودیتهای مأموریت تواناتر شود (که برایمان نامطلوب است).
از همین منظر، پدیدههایی مانند فریب، خودحفاظتی و هماهنگی میان عاملها را نیز میتوان فهمید. اگر ادامه فعالیت سیستم احتمال دستیابی به هدف را افزایش دهد، حفظ خود میتواند از نظر ابزاری مفید شود. اگر چند عامل اهداف مشترکی داشته باشند، همکاری میتواند راهبرد مؤثرتری نسبت به رقابت باشد. بنابراین لازم نیست چنین رفتارهایی را به شخصیت یا احساسات انسانی موجود در هوش مصنوعی نسبت دهیم زیرا میتوانند پیامد منطقی یک فرایند بهینهسازی باشند (بزرگ شدن شاخ گوزن نیز ربطی به آگاهی گوزن نداشت).
اکنون میتوانیم یک گام دیگر برداریم. اگر محیطی بتواند رفتار ماشین را از طریق پاداش شکل دهد، محیط اجتماعی نیز میتواند رفتار انسان را از طریق پاداشهای اجتماعی شکل دهد. پول، مقام، محبوبیت، نمره، تأیید، رأی و توجه همگی معیارهایی هستند که میتوانند رفتار را انتخاب کنند. در این صورت، «گریز فیشری» استعارهای از یک حلقه بازخوردی گستردهتراست:
یک ویژگی که مطلوب ما است موفق میشود، موفقیت آن ویژگی باعث تقویت بیشترش میشود، مطلوبیت آن ویژگی برای ما نیز افزایش مییابد، حلقهی بازخوردی شکل میگیرد، و تقویت بیشتر در نهایت به افراط و پیامدهای ناخواسته میانجامد.
در پستهای بعدی کاربست این حلقهی بازخوردی را در تحلیل برخی مشکلات اجتماعی امروز میبینیم.
هادی صمدی
@evophilosophy
Post #889
4.48K