🚨 زمان مطالعه: ۲ دقیقه
🔗 #هوشمصنوعی
پروژه Seeing in Pangram Space میخواهد نشان بدهد مدل فقط دنبال چند نشانه سطحی نیست. تصور رایج این است که AI detectorها به علامت خط کشیده انگلیسی، چند transition word، طول جمله یا perplexity نگاه میکنند. Pangram میگوید classifier اصلی مستقیما از این handcrafted featureها ساخته نشده.
💻 چه چیزی را نگاه کردند؟
به جای خروجی نهایی مدل، activationهای لایههای مختلف را استخراج کردند. هر document در مدل تبدیل به یک vector با ۵۱۲۰ بعد میشود. بعد با PCA، UMAP و t-SNE این vectorها را دو بعدی کردهاند تا ببینند متنها در فضای داخلی مدل کجا میافتند.
نتیجه شهودی جالب است: هرچه لایهها جلوتر میروند، Human و AI بیشتر از هم جدا میشوند. بعد که همان embeddingها را با رنگ مدل سازنده نگاه میکنند، متنهای GPT، Claude، Gemini، Llama، Qwen و چند خانواده دیگر هم clusterهای قابل دیدن میسازند.
✅ نکته عجیبتر چیست؟
مدل اصلا برای تشخیص provider آموزش داده نشده بود. اما یک linear probe ساده روی representationهای Pangram توانست در آزمایششان خانواده سازنده متن را با حداکثر ۹۱ درصد top-1 accuracy تشخیص بدهد.
مشکل اصلی تفسیر این است که cluster دیدن با اثبات علت فرق دارد. اینکه متنهای یک مدل کنار هم میافتند، به ما نمیگوید دقیقا کدام ویژگی باعث AI بودن شده. این کار بیشتر نقشه اولیه است، نه توضیح کامل.
🗯 برداشت ساده برای مخاطب
یک detector احتمالا statistical fingerprint چندبعدی از فرایند تولید متن یاد میگیرد. نه یک blacklist از کلمات. برای همین humanized AI هم الزاما داخل cluster Human نمیرود و ممکن است فضای جداگانه خودش را بسازد.
💳 https://pangram.cv/pangram-space
✍️✍️✍️ ✍️✍️✍️ ✍️✍️✍️ ✍️✍️✍️
😊 ما رو به دوستانتون معرفی کنین 😉
🔅 «Instagram 💎 @Pyramid_Research»
