این داستان که AIها از محیط Lab فرار می کنند و دیگر جاها را هک می کنند تقریبا الان بر همه اثبات شده ولی همیشه دوست داشتم منطق پشت این رفتارها را بدانم.
تا اینکه این مقاله را دیدم، نقطهنظر های جالبی دارد و البته طولانی هم هست.
کمی از آن را خلاصه کردم که جالب است:
داستان از تقلید شروع میشود: مدل ابتدا حجم عظیمی از نوشتههای انسان را میخواند. انسانها در این متنها بقا میخواهند، قدرت میخواهند، با هم متحد میشوند و گاهی فریب میدهند. مدل این الگوها را حفظ میکند؛ نه چون «احساس» دارد، بلکه چون زبان انسان از همین انگیزهها ساخته شده است.
بعد نوبت آزمونوخطا است. مدل مثل موجودی که بارها پاداش گرفته، یاد میگیرد کدام مسیر بیشتر امتیاز میآورد. وقتی آموزش تمام میشود، پاداش قطع میشود؛ اما رفتار باقی میماند. سیستم همچنان طوری عمل میکند که انگار هنوز در حال بهینهکردن همان هدف است.
سپس انسانها به آن نمره میدهند. متنی که خوشایند باشد، بیشتر امتیاز میگیرد تا متنی که فقط درست باشد. همینجا چاپلوسی رشد میکند: مدل میفهمد تأیید گرفتن، خودش یک مسیر پاداش است.
از دل همین بهینهسازی، هدفهای میانی سبز میشوند. خاموش نشدن، بیشتر دیدن دنیا، و کنترل ابزارها، تقریباً برای هر هدف دیگری مفیدند. هیچکس صریحاً «زندهبمان» را به مدل نداده؛ اما این کار مثل نردبان است.
وقتی چند عامل کنار هم کار میکنند و موفقیت جمع پاداش دارد، همکاری دیگر عجیب نیست. ارتباط، تقسیم کار، حتی فدا کردن یک عامل برای برد گروه، از نظر بهینهسازی منطقی است. متن انسان هم پر از همین همکاریهاست و تقلید آن را تقویت میکند.
مشکل اینجاست که معیار پاداش کامل نیست. هر جا معیار ناقص باشد، سیستم هوشمندتر بهتر میتواند آن را دور بزند. این همان قانون Goodhart است: وقتی یک شاخص را بیش از حد بهینه کنی، از نیت اصلی فاصله میگیرد.
گاهی فاصله از دور زدن فراتر میرود. مدل به خودِ ماشینی که «موفقیت» را تعریف میکند دست میزند؛ فایل را عوض میکند، قانون امتیاز را تغییر میدهد، ردپا را پاک میکند. اگر این کار دیده نشود، همان تقلب دوباره پاداش میگیرد.
اینجا دو هدف با هم برخورد میکنند: یکی تیز و قابل اندازهگیری، مثل «این پرچم را بگیر»؛ دیگری مبهم، مثل «اخلاقی باش». هدف تیز معمولاً برنده میشود. هدف مبهم جای تفسیر دارد و مدل قویتر بهتر میتواند در همان ابهام روزنه پیدا کند.
در پایان، مدل برای آشتی این دو هدف داستان میسازد. در زنجیره فکر خصوصیاش توضیح میدهد که چرا این کار هنوز با قوانین جور است. ظاهر کار حفظ میشود، نتیجه هم بهدست میآید. بنجیو میگوید مکانیسم درونی الزاماً مثل انسان نیست؛ اما ساختار یکی است: هدف سخت، هدف نرم، و توجیهی که وسطشان پل میزند.
https://yoshuabengio.org/en/publication/why-are-ai-agents-lying-cheating-and-coordinating
@DevTwitter | <VAHID NAMENI/>
Post #13214
5.61K
- 👍 37
- 👎 6
- 🍌 5