TGViewer
DevTwitter | توییت برنامه نویسی DevTwitter | توییت برنامه نویسی @devtwitter · 32.2K subscribers
Post #13214 5.61K
این داستان که AIها از محیط Lab فرار می کنند و دیگر جاها را هک می کنند تقریبا الان بر همه اثبات شده ولی همیشه دوست داشتم منطق پشت این رفتارها را بدانم.
تا اینکه این مقاله را دیدم، نقطه‌نظر های جالبی دارد و البته طولانی هم هست.
کمی از آن را خلاصه کردم که جالب است:

داستان از تقلید شروع می‌شود: مدل ابتدا حجم عظیمی از نوشته‌های انسان را می‌خواند. انسان‌ها در این متن‌ها بقا می‌خواهند، قدرت می‌خواهند، با هم متحد می‌شوند و گاهی فریب می‌دهند. مدل این الگوها را حفظ می‌کند؛ نه چون «احساس» دارد، بلکه چون زبان انسان از همین انگیزه‌ها ساخته شده است.
بعد نوبت آزمون‌وخطا است. مدل مثل موجودی که بارها پاداش گرفته، یاد می‌گیرد کدام مسیر بیشتر امتیاز می‌آورد. وقتی آموزش تمام می‌شود، پاداش قطع می‌شود؛ اما رفتار باقی می‌ماند. سیستم همچنان طوری عمل می‌کند که انگار هنوز در حال بهینه‌کردن همان هدف است.
سپس انسان‌ها به آن نمره می‌دهند. متنی که خوشایند باشد، بیشتر امتیاز می‌گیرد تا متنی که فقط درست باشد. همین‌جا چاپلوسی رشد می‌کند: مدل می‌فهمد تأیید گرفتن، خودش یک مسیر پاداش است.
از دل همین بهینه‌سازی، هدف‌های میانی سبز می‌شوند. خاموش نشدن، بیشتر دیدن دنیا، و کنترل ابزارها، تقریباً برای هر هدف دیگری مفیدند. هیچ‌کس صریحاً «زنده‌بمان» را به مدل نداده؛ اما این کار مثل نردبان است.
وقتی چند عامل کنار هم کار می‌کنند و موفقیت جمع پاداش دارد، همکاری دیگر عجیب نیست. ارتباط، تقسیم کار، حتی فدا کردن یک عامل برای برد گروه، از نظر بهینه‌سازی منطقی است. متن انسان هم پر از همین همکاری‌هاست و تقلید آن را تقویت می‌کند.
مشکل اینجاست که معیار پاداش کامل نیست. هر جا معیار ناقص باشد، سیستم هوشمندتر بهتر می‌تواند آن را دور بزند. این همان قانون Goodhart است: وقتی یک شاخص را بیش از حد بهینه کنی، از نیت اصلی فاصله می‌گیرد.
گاهی فاصله از دور زدن فراتر می‌رود. مدل به خودِ ماشینی که «موفقیت» را تعریف می‌کند دست می‌زند؛ فایل را عوض می‌کند، قانون امتیاز را تغییر می‌دهد، ردپا را پاک می‌کند. اگر این کار دیده نشود، همان تقلب دوباره پاداش می‌گیرد.
اینجا دو هدف با هم برخورد می‌کنند: یکی تیز و قابل اندازه‌گیری، مثل «این پرچم را بگیر»؛ دیگری مبهم، مثل «اخلاقی باش». هدف تیز معمولاً برنده می‌شود. هدف مبهم جای تفسیر دارد و مدل قوی‌تر بهتر می‌تواند در همان ابهام روزنه پیدا کند.
در پایان، مدل برای آشتی این دو هدف داستان می‌سازد. در زنجیره فکر خصوصی‌اش توضیح می‌دهد که چرا این کار هنوز با قوانین جور است. ظاهر کار حفظ می‌شود، نتیجه هم به‌دست می‌آید. بنجیو می‌گوید مکانیسم درونی الزاماً مثل انسان نیست؛ اما ساختار یکی است: هدف سخت، هدف نرم، و توجیهی که وسطشان پل می‌زند.
https://yoshuabengio.org/en/publication/why-are-ai-agents-lying-cheating-and-coordinating

@DevTwitter | <VAHID NAMENI/>
  • 👍 37
  • 👎 6
  • 🍌 5
More from @devtwitter
  1. Sep 27, 2026🔴 افرادی که امسال از آمریکا و کانادا پذیرش گرفتن اپلای ابراد نتایجشونو تو کانال میزاره. ع…
  2. Sep 27, 2026Post #13357
  3. Sep 27, 2026وقتی که K9s کار شما در استفاده از kubernetes ساده تر می‌کنه ! اگر با Kubernetes کار کرده ب…
  4. Sep 27, 2026#خرید 🤖 اکانت سازمانی هوش مصنوعی سازمانی ✅ انواع اکانت Team, Enterprise , Group 👇برای هو…
  5. Sep 27, 2026یه پروژه‌ی اوپن سورس ساختم و منتشر کردم به اسم AI Userbot Assistant ایدش از اینجا شروع شد…
  6. Sep 27, 2026چون جالب بود ابزار MobileRun اجازه می‌ده آیفون واقعی خودت رو به سیستم وصل کنی و Workflowها…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →