TGViewer
NLP stuff NLP stuff @nlp_stuff · 3.86K subscribers
Post #199 2.7K
آقای تورینگ! تست شما پاس شد؛ لطفا سوال بعدی!

چند وقتی هست که مدل GPT-3 معرفی شده و هر روز که از خواب پا میشیم به زیبا بودن این مدل بیشتر و بیشتر پی می‌بریم. از معرفی ابزار copilot توسط گیت‌هاب گرفته (که براساس GPT-3 بود و بر اساس function definition به زبان طبیعی، به ۸۰ زبان زنده دنیا کدنویسی می‌کرد) تا این مقاله از خانوم کلارک که به عنوان یکی از برجسته‌ترین مقالات رویداد ACLNLP2021 انتخاب شده است. در این مقاله درواقع چارچوبی برای تست انسانی مدل‌های تولید زبان طبیعی (NLG) معرفی شده است و در کنار اون نتایج ارزیابی انسانی مدل GPT-3 بررسی شده است.

حتما می‌دونید که یکی از اهداف مقدس آلن تورینگ فقید در دهه ۵۰ میلادی، طراحی سیستمی بود که اگر جملاتی به زبان انگلیسی تولید می‌کرد و به انسان‌های مختلف نشان داده می‌شد، کسی قادر نباشد که مشخص کند تولیدکننده آن متن‌ها ماشین است. در این مقاله خانوم کلارک و دوستان با استفاده از ابزار Amazon Mechanical Turk که امکان crowdsourcing را فراهم می‌کند، این تست را بر روی مدل GPT-3 انجام دادند. تست‌ها در سه دامنه داستان‌های کوتاه، مقاله کوتاه خبری و دستورآشپزی بودند. شاید جالب باشه که بدونید کیفیت تشخیص ارزیابی‌کنندگان این متون، حدود ۵۰ درصد بوده است!!! یعنی دقیقا با شانس رندم توانستند machine-generated بودن این متون را تشخیص دهند. اما کار اصلی این مقاله، انجام آزمایشاتی در راستای آموزش ارزیابی‌کنندگان برای ارزیابی این مجموعه متون تستی بود تا کیفیت تشخیص آن‌ها بهبود یابد. در این مقاله ۳ سناریو برای آموزش انتخاب شده است. در سناریو اول ابتدا در کنار هر متن تستی، چند جمله در جهت راهنمایی برای تشخیص کیفیت متن گذاشته می‌شود و سپس ارزیابی صورت می‌گیرد. در سناریوی بعدی در هر متن تستی، بعد از انتخاب گزینه توسط ارزیابی‌کننده (در ابزار AMT می‌تونید برای هر تست گزینه‌هایی انتخاب کنید که ارزیابی‌کننده‌ها از بین اون‌ها انتخاب کنند و در اینجا به صورت ساده ۴ گزینه درنظر گرفته شده است. گزینه اول ؛ مطمئنا انسان نوشته است، گزینه دوم؛ احتمالا انسان نوشته است، گزینه سوم؛ احتمالا ماشین نوشته است و گزینه آخر؛ قطعا ماشین نوشته است انتخاب شده‌اند) در صورتی که اشتباه انتخاب می‌کرده‌است، گزینه درست به همراه دلایلی برای توضیح به ارزیابی‌کنندگان نشان داده می‌شده است. همچنین در سناریو سوم دو متن که با جملات یکسان اولیه یکی توسط انسان و دیگری توسط ماشین تولید شده است به ارزیابی‌کنندگان داده شده و پس از انتخاب گزینه، گزینه درست به آن‌ها نمایش داده شده است. تا اینجا اگه فکر می‌کنید که این سناریوها در بهبود کیفیت تشخیص ارزیابی‌کنندگان خیلی موثر بودند باید بگم که سخت در اشتباهید!! مدل GPT-3 حتی در این سناریوها نیز قدرت خودش رو نشون داد و فقط سناریو دوم تونست یه مقدار موثر باشه و به‌طور میانگین حدود ۶ درصد تشخیص رو بهتر کنه!

نویسندگان این مقاله با تحلیل و بررسی نتایج آزمایشات دریافتند که یکی از عوامل گمراهی عامل انسانی در تشخیص ماشینی بودن متون، عدم درک درست عامل انسانی از توانایی ماشین بوده! به همین دلیل، ارزیابی‌کنندگان برای تشخیص، به‌مقدار زیاد بر روی ویژگی‌های ظاهری متون مانند استایل و گرامر تکیه می‌کردند و با انجام آموزش‌هایی که در بالا به اون‌ها اشاره شد، آگاه‌تر شدند و برای تشخیص به ویژگی‌های محتوایی و معنایی نیز توجه بیشتری کردند و از لایه ظاهری برای تشخیص عبور کردند( که البته این عبور خیلی موفقیت‌آمیز نبود همون‌طور که گفتیم!)
در نهایت هم چندتا پیشنهاد برای محققان حوزه NLG دارند که باید سرلوحه کار خودشون قرار بدهند. اول اینکه، نتایج تست انسانی مدل‌هاشون رو سعی کنند با چارچوب معرفی شده گزارش کنند. دوم اینکه در ارزیابی‌های انسانی از لایه ظاهر عبور کنند و توجه بیشتری به معنا و مفید بودن متن بکنند. مثلا یک تست جذاب برای این موضوع این است که از ارزیابی‌کننده درخواست کنند تا در ادامه متن داده شده، متنی را بنویسند و توانایی همراهی ارزیابی‌کننده با متن را اندازه‌گیری کنند. همچنین از ارزیابی متن‌های کوتاه عبور کرده و به سمت متن‌های طولانی‌تر بروند.
این پیشنهاد‌ها به طور ضمنی چالش‌های بعدی حوزه NLG رو هم مشخص می‌کنند. به‌همین خاطر توصیه می‌کنیم این مقاله رو حتما اگر نمی‌خونید حداقل یه نگاه بهش بندازید خداوکیلی!

لینک مقاله:
https://arxiv.org/abs/2107.00061

پ.ن.۱: به عکس دقت کنید! به نظرتون کدومش کار ماشینه؟ ☺️

پ.ن.۲: جا داره یه نگاه دوباره به این پست از کانال بندازید که بررسی مقاله‌ی برنده‌ی ACL2020 بود و اون هم روی یک نگاه دیگه از ارزیابی مدل تکیه کرده بود:
https://t.me/nlp_stuff/48

#read
#paper

@nlp_stuff
Telegram stuff
More from @nlp_stuff
  1. Jan 6, 2026اندر حکایات بازی با کلمات: AI Engineering vs ML Engineering/Data Scientist این روزها عناوی…
  2. Mar 3, 2025مفهوم Agent چیست و چگونه کار می‌کنند؟ خانم چیپ هوین بلاگ پست مفصلی راجع به Agent (به قول ر…
  3. Feb 28, 2025خلاصه‌تر فکر کن از اونجایی که در مسائل استدلالی (reasoning) ، مدل برای رسیدن به جواب نهایی…
  4. Feb 23, 2025چه قدر تا بی‌کارشدن بک‌اندی‌ها فاصله داریم؟ عمده استفاده برنامه‌نویس‌ها از LLM‌ها در سطح پ…
  5. Feb 20, 2025به سوی سیستم‌۲ پیشرفت‌های هوش مصنوعی در دهه ۲۰۱۰، مدیون آموزش مدل‌های بزرگ دیپ لرنینگی روی…
  6. Feb 8, 2025مدل‌های استدلالی (reasoning) چیست و چگونه ساخته می‌شوند؟ حتما این روزها بارها مدل‌های استد…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →