TGViewer
NoteCasts NoteCasts @navidcasts · 159 subscribers
Post #66 149
Audio
اوپن‌ای‌آی یک روش اثباتی و زودهنگام به نام «اعترافات» (confessions) را معرفی کرده است که به منظور افزایش شفافیت و صداقت مدل‌های زبان بزرگ طراحی شده است.

👉 @navidcasts 🎓

در این رویکرد، مدل علاوه بر پاسخ اصلی به کاربر، یک خروجی ثانویه ارائه می‌دهد که در آن صراحتاً به نقض دستورالعمل‌ها یا استفاده از میان‌برهای ناخواسته اعتراف می‌کند. نکته کلیدی این است که اعترافات صرفاً بر اساس صداقت خود مدل پاداش می‌گیرند و پذیرش رفتار نامطلوب، بر پاداش پاسخ اصلی تأثیری نمی‌گذارد تا انگیزه گزارش‌دهی صادقانه از اهداف عملکردی مدل جدا شود.

👉 @navidcasts 🎓

بنابراین، این مکانیسم نه برای جلوگیری از رفتارهای نامناسب، بلکه به عنوان یک ابزار نظارت و تشخیص عمل می‌کند تا توسعه‌دهندگان بتوانند عملکرد داخلی مدل‌ها را بهتر درک کرده و ایمنی آن‌ها را افزایش دهند.

لینک ویدیو در یوتیوب : https://youtu.be/OsqrWIHnouA

لینک توضیحات متنی در وب سایت OpenAI : https://openai.com/index/how-confessions-can-keep-language-models-honest/
  • ❤ 1
  • ❤‍🔥 1
  • 👍 1
More from @navidcasts
  1. Sep 23, 2026https://youtu.be/mPr2iboMI5A?si=Ac5iAx4lstOBPfoz
  2. Sep 21, 2026هشدار امنیتی مشترک نهادهای اطلاعاتی بریتانیا، آمریکا و هلند نشان می‌دهد که عاملان سایبری و…
  3. Sep 18, 2026این منبع یک مقاله پژوهشی تخصصی است که روشی نوآورانه برای شناسایی دقیق پارامترهای مودال ساز…
  4. Sep 7, 2026این مقاله، با شروعی بر مبنای ماجرای پرحاشیه کیتی جنوویس، به تحلیل چرایی عدم مداخله افراد د…
  5. Sep 6, 2026این مقاله استدلال می‌کند که دموکراسی لیبرال در معرض خطر جدی است زیرا حامیان آن در بازگو کر…
  6. Jul 6, 2026این وویس به معرفی و تبیین مهندسی عامل (Agent Engineering) می‌پردازد و آن را به عنوان یک نظ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →