یک پژوهش جدید روشی به نام PIR معرفی کرده که سعی میکنه بفهمه مدل واقعا جواب یک سوال رو نمیدونه، یا جواب رو میدونه اما پنهانش میکنه.
💥برخلاف روشهایی که فقط خروجی مدل رو بررسی میکنن، PIR سراغ وضعیتهای داخلی مدل میره و بررسی میکنه کدوم پاسخ برای مدل به عنوان گزینه درست شناخته شده.
این روش روی ۸ مدل از خانوادههای Gemma، Qwen، Llama، Mistral و Phi آزمایش شده و حتی در سناریوهایی که مدلها عمدا پاسخ درست رو پنهان میکردن، تونسته نشونههای شناخت پاسخ رو شناسایی کنه.❗️
کاربرد این ایده فقط پیدا کردن «دروغ» مدل نیست. PIR میتونه برای بررسی Sandbagging و همینطور ارزیابی Unlearning هم مفید باشه؛ یعنی بفهمیم یک دانش واقعا از مدل حذف شده یا فقط دیگه در خروجی دیده نمیشه.
🤖 GenX؛ برای توسعهدهندگانی که آینده رو میسازن
✅ Telegram | ✅ twitter | Linkedin |✅ Instagram
Post #372
417

- 👍 1