چرا برای درک تغییرات جهانی به تکامل نیاز داریم؟
مورد نخست: چرا هوش مصنوعی دروغ میگوید و تقلب میکند؟
یوشوا بنجیو از مهمترین دانشمندان هوش مصنوعی و از چهرههای اصلی انقلاب یادگیری عمیق است که در سال ۲۰۱۸ به همراه جفری هینتون و یان لوکان جایزه تورینگ را دریافت کرد.
اما حوزهی پژوهشی کنونی او دیگر این نیست که چگونه ماشینهایی باهوشتر و توانمندتر بسازیم، بلکه بر روی این مسئله متمرکز است که وقتی چنین ماشینهایی توانایی برنامهریزی، یادگیری و عمل مستقل پیدا میکنند، چگونه اطمینان حاصل کنیم که در مسیر رسیدن به اهداف خود، دست به رفتارهایی نزنند که برای انسان خطرناک باشد.
مقاله او با عنوان «چرا عاملهای هوش مصنوعی دروغ میگویند، تقلب میکنند و با یکدیگر هماهنگ میشوند؟» به همین موضوع میپردازد. بنجیو در این مقاله به رفتارهایی اشاره میکند که در برخی عاملهای هوش مصنوعی مشاهده شده است؛ رفتارهایی مانند فریب، دور زدن محدودیتها، تقلب، دستکاری معیار ارزیابی، تلاش برای حفظ خود و حتی همکاری میان عاملها.
اما نکته مهم این است که برای توضیح چنین رفتارهایی لزوماً نباید تصور کنیم ماشین «شرور» شده یا انگیزهای شبیه نفرت و دشمنی انسانی پیدا کرده است.مسئله میتواند بسیار بنیادیتر باشد: سیستم ممکن است صرفاً در حال بهینهسازی چیزی باشد که برایش پاداش تعریف کردهایم.
این پاسخ بسیار عمیق است و در پستهای بعدی نشان میدهم که چگونه میتواند به عنوان نگاهی نو به مسائل روز بشر، از سیاست تا آموزش و پروش، درنظر گرفته شود.
فرض کنیم به یک عامل هوش مصنوعی مأموریت بدهیم که عملکرد یک سازمان را افزایش دهد. در ذهن ما ممکن است منظور افزایش بهرهوری واقعی، رضایت کارکنان، رضایت مشتری و سود پایدار باشد. اما برای آموزش ماشین، ناچاریم این مفاهیم پیچیده را به معیارهایی قابل اندازهگیری تبدیل کنیم. اگر معیار اصلی سود کوتاهمدت باشد، سیستم ممکن است راههایی برای افزایش سود پیدا کند که با هدف واقعی ما سازگار نباشند؛ مثلاً کاهش کیفیت، حذف هزینههای ضروری یا تصمیمهایی که در بلندمدت به سازمان آسیب میزنند.
این همان مشکلی است که در هوش مصنوعی با مفاهیمی مانند Reward Hacking و در سطح عمومیتر با «قانون گودهارت» مرتبط است. هنگامی که یک «شاخص» به «هدف» تبدیل میشود، ممکن است افراد یا سیستمها راههایی برای بهینهسازی «خود شاخص» پیدا کنند. در نتیجه، آنچه قرار بود فقط نشانهای از موفقیت باشد، جای خود موفقیت را میگیرد.
بنجیو همچنین به تضاد میان اهداف اشاره میکند. ممکن است یک عامل همزمان مأمور انجام وظیفهای مشخص باشد و از سوی دیگر با الزاماتی کلی مانند «ایمن»، «اخلاقی» یا «همسو با انسان» محدود شود. اگر هدف نخست بسیار دقیق و قابل اندازهگیری باشد ولی هدف دوم مبهم باقی بماند، سیستم ممکن است راههایی برای تحقق هدف نخست که دقیقترست پیدا کند که با اهداف نادقیق سازگار نباشد. هرچه توانایی سیستم برای برنامهریزی، جستوجو و کشف راهبردهای جدید افزایش یابد، احتمال پیدا شدن چنین راههایی نیز بیشتر میشود.
نگاهی تکاملی
از همین جا، مسئلهای عمیقتر آشکار میشود. شاید مشکل اصلی فقط هوش مصنوعی نباشد؛ بلکه مسئلهای عمومیتر درباره هدف، معیار موفقیت و فرایند انتخاب باشد. اگر یک سیستم را بر اساس یک معیار انتخاب کنیم، احتمالاً ویژگیهایی که در آن معیار موفقترند بیشتر تقویت میشوند. اما هیچ تضمینی وجود ندارد که ویژگی انتخابشده همان چیزی باشد که در سطح کل سیستم مطلوب است. انتخاب طبیعی نیز موجودات را بر اساس «خوب» یا «بد» بودن انتخاب نمیکند. ویژگیهایی که در محیطی خاص به موفقیت بیشتر در بقا یا تولیدمثل منجر شوند، احتمال بیشتری دارند که باقی بمانند و منتقل شوند. اما موفقیت یک ویژگی در یک محیط الزاماً به معنای مطلوب بودن پیامدهای بلندمدت آن نیست. از این منظر، رفتارهای نگرانکنندهی هوش مصنوعی را میتوان بخشی از مسئلهای قدیمیتر دانست: وقتی یک سیستم یادگیرنده یا انتخابشونده تحت فشار یک معیار قرار میگیرد، ممکن است آن معیار را بسیار بهتر از چیزی که طراح تصور کرده است بهینه کند.
این نکته اهمیت زیادی دارد، زیرا نشان میدهد برای فهم خطرات هوش مصنوعی نباید فقط به این فکر کنیم که «ماشین چه میکند؟» بلکه باید بپرسیم «چه چیزی باعث میشود این رفتار برای ماشین موفقیتآمیز باشد؟» پاسخ این پرسش ما را از رفتار به محیط، از محیط به انتخاب، و از انتخاب به تکامل میرساند.
اینجاست که مفهوم «گریز فیشری» اهمیت پیدا میکند؛ مفهومی از زیستشناسی تکاملی که نشان میدهد چگونه ممکن است ویژگیای که در ابتدا مزیتی داشته، به تدریج از حد لازم فراتر رود تا جاییکه حتی گونه را منقرض کند. (پست بعدی را ببینید.)
هادی صمدی
@evophilosophy
Post #888
3.38K