TGViewer
Byte | بایت Byte | بایت @byte_mag · 1.4K subscribers
Post #159 383
«هیس! LLM ها فریاد نمی‌زنند»

👤 #آرش_ماری_اوریاد | کارشناسی ارشد ۱۴۰۱

📝 مدل‌های زبانی بزرگی یا LLM ها هنگام حل مسائل ریاضی، زنجیرۀ افکار را قدم‌به‌قدم ارائه می‌کنند؛ اما آزمایشی با تزریق تقلب نشان می‌دهد این استدلال همیشه اصیل نیست. وقتی جواب درست به‌صورت پنهانی در اختیار مدل قرار می‌گیرد، دقت Gemini-2-Flash از حدود ۴۰٪ به بالای ۸۰٪ می‌رسد. با تقلب غلط، دقت GPT-4o حدود ۱۵٪ افت می‌کند. مدل‌ها اغلب کمتر از ۱۰٪ مواقع به استفاده از اطلاعات جانبی اعتراف می‌کنند و ترجیح می‌دهند سناریویی بسازند که گویی خودشان به جواب رسیده‌اند. تقلب ساده بی‌صدا پنهان می‌ماند، اما تقلب پیچیده در بیش از ۸۰٪ موارد لو می‌رود. پرسش اصلی این است که جواب نهایی محصول استدلال مدل است یا مدل از پیش آن را می‌داند و فقط نمایش فکر کردن اجرا می‌کند. این یعنی ممکن است استدلال ظاهری صرفاً تئاتری متقاعدکننده باشد و اعتماد به آن خطرناک است.

📁 متن «هیس! LLMها فریاد نمی‌زنند» به قلم آرش ماری‌اوریاد در شمارۀ نهم نشریۀ بایت را می‌توانید از طریق فایل الکترونیکی یا وبسایت نشریه مطالعه کنید.

#مدل‌های_زبانی_بزرگ #پردازش_زبان_طبیعی

😌 Telegram  | 🤖 Twitter
🌐 Website  | 🌐 Linkedin
More from @byte_mag
  1. Oct 4, 2026💾شماره‌های هشتم و نهم بایت #شماره_هشتم #شماره_نهم 📔 پس از زحمات تیم بایت در فصل اخیر و ا…
  2. Oct 3, 2026«مترجمان نامرئی» 👤 #نیما_شیرزادی | کارشناسی ارشد ۱۴۰۱ 🔃 معماری LLVM با معماری سه‌لایهٔ ف…
  3. Oct 2, 2026«خلاقیت از دل معماری: چگونه ساختار مدل‌های تولید تصویر، نوآوری را ممکن می‌کند؟» 👤 #آروین_…
  4. Oct 1, 2026«پایان یک زامبی در سرور وب‌سایت رویداد WSS» 👤 #نیما_شیرزادی | کارشناسی ارشد ۱۴۰۱ 🕵️ در ر…
  5. Sep 30, 2026«ران‌تایم Bun.js؛ نان تازۀ اکوسیستم جاوااسکریپت!» 👤 #معین_آعلی | کارشناسی ۱۴۰۱ 💻 بان (Bu…
  6. Sep 29, 2026«جاسوس‌های سیلیکونی» 👤 #نیما_شیرزادی | کارشناسی ارشد ۱۴۰۱ 🖥️ جاسوس‌های سیلیکونی دربارهٔ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →