یه مقاله ترسناک امروز خوندم پشمام ریخت، به تیم اومدن ۱۱۱ میلیون رفرنس رو توی ۲.۵ میلیون مقاله بررسی کردن و دیدن از ۲۰۲۳ به این ور، آمار Citationهای فیک عجیب رفته بالا... فقط واسه سال ۲۰۲۵ تخمین میزنن ۱۴۶ هزار تا رفرنس غیرواقعی تولید شده.
نکتهش اینه که این یه مورد "چند تا آدم متقلب" نیست؛ Hallucination توی کل مقالات پخش شده. یعنی طرف مقاله رو نوشته، آخرش واسه رفرنسها داده یه LLM براش لیست ردیف کرده، اونم از خودش اسم کتاب و مقاله درآورده. بیشترین نفوذ هم توی کامپیوتر و علوم اجتماعی بوده؛ جاهایی که AI-assisted writing بیشتر استفاده میشه. جالبه که نویسندههای تازهکار و تیمهای کوچیک بیشتر از همه توی این تله افتادن.
من خودم وقتی داشتم یه Agent واسه Research خودکار میساختم، دقیقاً به همین خوردم. مدلها مخصوصاً مدلهای کوچیکتر، وقتی تحت فشار قرار میگیرن یا ابزار جستجو دم دستشون نیست، شروع میکنن به ساختن رفرنسهایی که خیلی "منطقی" به نظر میان ولی اصلاً وجود ندارن. بدتر اینکه این رفرنسهای فیک بیشتر به نفع آدمهای معروف و مردهای پرکار تموم شده؛ یعنی AI داره Biasهای قبلی رو توی سیستم اعتباردهی علم هم بازتولید میکنه.
فاجعه اصلی کجاست؟ اینکه سیستمهای بازبینی و داوری مجلات اصلاً متوجه این موضوع نمیشن. یعنی این دیتای سمی داره وارد پایگاه دادههای دائمی میشه. از اون طرف، ما داریم مدلهای جدید رو روی همین مقالات Train میکنیم. این یعنی یه Feedback Loop سمی؛ یعنی مدل از روی توهمات مدل قبلی یاد میگیره.
لینک مقاله:
https://arxiv.org/abs/2605.07723
🛠 Join @LLMEngineers Community
Post #361
1.5K