TGViewer
GenX GenX @genx_build · 1.58K subscribers
Post #372 417
یک پژوهش جدید روشی به نام PIR معرفی کرده که سعی می‌کنه بفهمه مدل واقعا جواب یک سوال رو نمی‌دونه، یا جواب رو می‌دونه اما پنهانش می‌کنه.

💥برخلاف روش‌هایی که فقط خروجی مدل رو بررسی می‌کنن، PIR سراغ وضعیت‌های داخلی مدل می‌ره و بررسی می‌کنه کدوم پاسخ برای مدل به‌ عنوان گزینه درست شناخته شده.

این روش روی ۸ مدل از خانواده‌های Gemma، Qwen، Llama، Mistral و Phi آزمایش شده و حتی در سناریوهایی که مدل‌ها عمدا پاسخ درست رو پنهان می‌کردن، تونسته نشونه‌های شناخت پاسخ رو شناسایی کنه.❗️

کاربرد این ایده فقط پیدا کردن «دروغ» مدل نیست. PIR می‌تونه برای بررسی Sandbagging و همین‌طور ارزیابی Unlearning هم مفید باشه؛ یعنی بفهمیم یک دانش واقعا از مدل حذف شده یا فقط دیگه در خروجی دیده نمی‌شه.


🤖 GenX؛ برای توسعه‌دهندگانی که آینده رو می‌سازن


✅ Telegram | ✅ twitter | Linkedin |✅ Instagram
  • 👍 1
More from @genx_build
  1. Sep 29, 2026یک پژوهش تازه سراغ یکی از مسئله‌های مهم در Agentهای چند مرحله‌ای رفته: ممکنه همه Tool Call…
  2. Sep 28, 2026وقتی چند Agent همزمان روی یک پروژه کار می‌کنن، مسئله مهم طراحی درست Workflow بین اون‌هاست.…
  3. Sep 20, 2026ابزار Copilot علاوه‌بر افزایش سرعت کدنویسی، داره شکل تقسیم کار در تیم‌های توسعه رو هم تغیی…
  4. Sep 19, 2026نقش هوش مصنوعی در پژوهش داره از «کمک به انجام چند کار» فراتر می‌ره و به همکاری در سطح یک پ…
  5. Sep 15, 2026شرکت DeepSeek مدل جدید DeepSeek-V4.1-Flash رو معرفی کرده؛ مدلی که می‌تونه متن و تصویر رو پ…
  6. Sep 14, 2026مهندسی زمینه یا Context Engineering فقط به این معنی نیست که اطلاعات بیشتری در اختیار Agent…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →