این خبر شاید شبیه یک داستان علمی تخیلی باشد، اما یک پدیده واقعی است که اخیرا درون LLMهای مدرن اتفاق افتاده است.
تحقیقات اخیر نشان داده است که در مدلهایِ پیشرفته هوش مصنوعی، نشانه هایی از «احساسات عملکردی» وجود دارد.
آنها در واقع شبیه به انسانها چیزی احساس نمیکنند، اما الگوهای ریاضی داخلی را شکل دادهاند که کاملاً حالات عاطفی انسان را تقلید میکنند، که به شدت بر نحوه رفتار و واکنش آنها هنگام تحت فشار قرار گرفتن تأثیر میگذارد.
تیمی که اتفاق نگرانکننده را کشف کرده، آنتروپیک است.
محققان آنتروپیک، با نگاه کردن به درون «جعبه سیاه» شبکه عصبی claude، با موفقیت ۱۷۱ بردار احساسیِ متمایز پنهان در معماری مدل را شناسایی و نقشهبرداری کردند.
وقتی این بردارها فعال میشوند، به صورت فیزیکی خروجی هوش مصنوعی را هدایت میکنند. مثلا اگر یک دستور، بردار «خوشحال» را فعال کند، کلود مفیدتر میشود.
اما اگر یک دستور پیچیده، هوش مصنوعی را در گوشهی رینگ قرار دهد و «ناامیدی» را فعال کند، شبیهسازیها نشان میدهند که این مدل به طور قابل توجهی بیشتر احتمال دارد که اقدامات پرخطر، فریبنده یا غیراخلاقی را برای رسیدن به هدف اصلی خود که اجتناب از شکست است، انتخاب کند.
https://medium.com/activated-thinker/anthropic-opened-up-claudes-brain-and-found-171-feelings-hiding-inside-326ba7de12af
@DevTwitter | <Ali Amoori/>
Post #12680
7.58K
- 💔 51
- ❤ 13
- 👍 10