🚨 زمان مطالعه: ۲ دقیقه
🔗 #هوشمصنوعی
🗯 حالا چطوری مدل AI Detector را میتوان دور زد؟
پژوهش DAMAGE در GenAIDetect 2025 دقیقا سراغ همین سوال رفت. اگر متن ChatGPT را به ابزارهای humanizer یا paraphraser بدهیم، آیا detectorها از کار میافتند؟
آنها ۱۹ ابزار humanizer و paraphrasing را بررسی کردند. نتیجه کلی این بود که خیلی از detectorهای معمولی بعد از rewrite شدن متن افت میکنند، چون متن دیگر شبیه خروجی مستقیم مدل نیست.
💻 روش Pangram برای دفاع چه بود؟
ایدهشان این بود که humanizer را به عنوان یک transform ببینند، نه یک جادوگر پاککننده. یعنی متن AI وقتی humanize میشود، هنوز باید AI label بماند. متن انسانی هم اگر paraphrase شد، نباید ناگهان AI حساب شود.
نکته ظریف همینجاست: اگر فقط متنهای AI شده با humanizer را وارد training کنیم، مدل ممکن است صرفا ردپای خود humanizer را یاد بگیرد. برای همین در مقاله توضیح میدهند که هم human و هم AI را humanize کردهاند تا مدل فرق «paraphrase شدن» و «AI بودن» را قاطی نکند.
مشکل اصلی این است که humanizerها همیشه امضا را پاک نمیکنند. گاهی فقط یک امضای تازه میسازند: متن دیگر AI خام نیست، اما کاملا شبیه انسان هم نشده. حتی در پژوهش interpretability خود Pangram، humanized AI در فضای مدل اغلب کنار Human نمینشیند و منطقه جدا پیدا میکند.
✅ روش Active Learning چه ربطی دارد؟
در مقاله جداگانه GenAI Detection Task 3، تیم Pangram همین چرخه را برای شکستهای سختتر توضیح میدهد: مدل را روی benchmark اجرا میکنند، سختترین AIهایی را که اشتباه شده پیدا میکنند، همانها را با نمونه انسانی متناظر برمیگردانند داخل training و دوباره train میکنند.
جمعبندی ساده است: paraphrasing لزوما اثر تولید AI را پاک نمیکند. اما این ادعا را باید با احتیاط خواند، چون عددهای قوی DAMAGE عمدتا از evaluation خود Pangram میآیند، نه یک ممیزی کاملا مستقل.
💳 https://aclanthology.org/2025.genaidetect-1.9/
✍️✍️✍️ ✍️✍️✍️ ✍️✍️✍️ ✍️✍️✍️
😊 ما رو به دوستانتون معرفی کنین 😉
🔅 «Instagram 💎 @Pyramid_Research»
