اوپنایآی یک روش اثباتی و زودهنگام به نام «اعترافات» (confessions) را معرفی کرده است که به منظور افزایش شفافیت و صداقت مدلهای زبان بزرگ طراحی شده است.
👉 @navidcasts 🎓
در این رویکرد، مدل علاوه بر پاسخ اصلی به کاربر، یک خروجی ثانویه ارائه میدهد که در آن صراحتاً به نقض دستورالعملها یا استفاده از میانبرهای ناخواسته اعتراف میکند. نکته کلیدی این است که اعترافات صرفاً بر اساس صداقت خود مدل پاداش میگیرند و پذیرش رفتار نامطلوب، بر پاداش پاسخ اصلی تأثیری نمیگذارد تا انگیزه گزارشدهی صادقانه از اهداف عملکردی مدل جدا شود.
👉 @navidcasts 🎓
بنابراین، این مکانیسم نه برای جلوگیری از رفتارهای نامناسب، بلکه به عنوان یک ابزار نظارت و تشخیص عمل میکند تا توسعهدهندگان بتوانند عملکرد داخلی مدلها را بهتر درک کرده و ایمنی آنها را افزایش دهند.
لینک ویدیو در یوتیوب : https://youtu.be/OsqrWIHnouA
لینک توضیحات متنی در وب سایت OpenAI : https://openai.com/index/how-confessions-can-keep-language-models-honest/
Post #66
149
Audio
- ❤ 1
- ❤🔥 1
- 👍 1