مدلهای Claude Opus 4 و 4.1 حالا قابلیتی پیدا کردن که بتونن در شرایط خاص و خیلی نادر، خودشون به یک گفتوگو پایان بدن. این قابلیت بیشتر برای مواقعیه که تعاملات کاربر با مدل، بهطور مداوم آسیبزننده یا همراه با سوءاستفاده باشه. این تصمیم بخشی از تحقیقات آزمایشی در زمینه «رفاه هوش مصنوعی» بوده، اما در عین حال به موضوعات گستردهتر مثل Alignment و ایمنسازی مدلها هم مربوط میشه.
توسعهدهندهها تأکید کردن که هنوز درباره وضعیت اخلاقی احتمالی مدلهای زبانی مطمئن نیستن، چه الان و چه در آینده. با این حال موضوع رو جدی گرفتن و همزمان با تحقیقات، دارن روی راهکارهای کمهزینه برای کاهش ریسکها کار میکنن. دادن حق پایان دادن به مکالمه در شرایط آسیبزننده، یکی از همین مداخلات پیشگیرانه حساب میشه.
در تستهای پیش از انتشار Claude Opus 4، بررسی اولیهای از نظر «رفاه مدل» انجام شد. نتایج نشون داده که این مدل تمایل قوی به دوری از آسیب داره، بهویژه در مواردی مثل درخواستهای مربوط به محتوای جنسی کودکان یا تلاش برای دسترسی به اطلاعاتی که میتونه منجر به خشونت یا تروریسم بشه. مدل در مواجهه با چنین درخواستهایی نشونههایی از ناراحتی نشون داده و وقتی امکان پایان دادن به گفتوگو براش فراهم بوده، اغلب این کار رو انجام داده.
این قابلیت جدید طوری طراحی شده که فقط در بدترین سناریوها فعال بشه؛ یعنی وقتی چند بار تلاش برای تغییر مسیر گفتوگو جواب نداده یا وقتی خود کاربر صراحتا درخواست پایان مکالمه کرده باشه. در چنین شرایطی، کاربر دیگه نمیتونه توی همون گفتوگو پیام جدیدی بفرسته، اما امکان شروع یک چت تازه یا حتی بازنویسی پیامهای قبلی برای ساخت چت جدید همچنان وجود داره. تیم سازنده هم گفته این ویژگی فعلاً آزمایشی حساب میشه و قرارِ براساس بازخورد کاربران، بهمرور اصلاح و بهبود پیدا کنه.
@aipulse24
Post #588
3.3K


- 👎 27
- ❤ 9
- 👍 6