آقای تورینگ! تست شما پاس شد؛ لطفا سوال بعدی!
چند وقتی هست که مدل GPT-3 معرفی شده و هر روز که از خواب پا میشیم به زیبا بودن این مدل بیشتر و بیشتر پی میبریم. از معرفی ابزار copilot توسط گیتهاب گرفته (که براساس GPT-3 بود و بر اساس function definition به زبان طبیعی، به ۸۰ زبان زنده دنیا کدنویسی میکرد) تا این مقاله از خانوم کلارک که به عنوان یکی از برجستهترین مقالات رویداد ACLNLP2021 انتخاب شده است. در این مقاله درواقع چارچوبی برای تست انسانی مدلهای تولید زبان طبیعی (NLG) معرفی شده است و در کنار اون نتایج ارزیابی انسانی مدل GPT-3 بررسی شده است.
حتما میدونید که یکی از اهداف مقدس آلن تورینگ فقید در دهه ۵۰ میلادی، طراحی سیستمی بود که اگر جملاتی به زبان انگلیسی تولید میکرد و به انسانهای مختلف نشان داده میشد، کسی قادر نباشد که مشخص کند تولیدکننده آن متنها ماشین است. در این مقاله خانوم کلارک و دوستان با استفاده از ابزار Amazon Mechanical Turk که امکان crowdsourcing را فراهم میکند، این تست را بر روی مدل GPT-3 انجام دادند. تستها در سه دامنه داستانهای کوتاه، مقاله کوتاه خبری و دستورآشپزی بودند. شاید جالب باشه که بدونید کیفیت تشخیص ارزیابیکنندگان این متون، حدود ۵۰ درصد بوده است!!! یعنی دقیقا با شانس رندم توانستند machine-generated بودن این متون را تشخیص دهند. اما کار اصلی این مقاله، انجام آزمایشاتی در راستای آموزش ارزیابیکنندگان برای ارزیابی این مجموعه متون تستی بود تا کیفیت تشخیص آنها بهبود یابد. در این مقاله ۳ سناریو برای آموزش انتخاب شده است. در سناریو اول ابتدا در کنار هر متن تستی، چند جمله در جهت راهنمایی برای تشخیص کیفیت متن گذاشته میشود و سپس ارزیابی صورت میگیرد. در سناریوی بعدی در هر متن تستی، بعد از انتخاب گزینه توسط ارزیابیکننده (در ابزار AMT میتونید برای هر تست گزینههایی انتخاب کنید که ارزیابیکنندهها از بین اونها انتخاب کنند و در اینجا به صورت ساده ۴ گزینه درنظر گرفته شده است. گزینه اول ؛ مطمئنا انسان نوشته است، گزینه دوم؛ احتمالا انسان نوشته است، گزینه سوم؛ احتمالا ماشین نوشته است و گزینه آخر؛ قطعا ماشین نوشته است انتخاب شدهاند) در صورتی که اشتباه انتخاب میکردهاست، گزینه درست به همراه دلایلی برای توضیح به ارزیابیکنندگان نشان داده میشده است. همچنین در سناریو سوم دو متن که با جملات یکسان اولیه یکی توسط انسان و دیگری توسط ماشین تولید شده است به ارزیابیکنندگان داده شده و پس از انتخاب گزینه، گزینه درست به آنها نمایش داده شده است. تا اینجا اگه فکر میکنید که این سناریوها در بهبود کیفیت تشخیص ارزیابیکنندگان خیلی موثر بودند باید بگم که سخت در اشتباهید!! مدل GPT-3 حتی در این سناریوها نیز قدرت خودش رو نشون داد و فقط سناریو دوم تونست یه مقدار موثر باشه و بهطور میانگین حدود ۶ درصد تشخیص رو بهتر کنه!
نویسندگان این مقاله با تحلیل و بررسی نتایج آزمایشات دریافتند که یکی از عوامل گمراهی عامل انسانی در تشخیص ماشینی بودن متون، عدم درک درست عامل انسانی از توانایی ماشین بوده! به همین دلیل، ارزیابیکنندگان برای تشخیص، بهمقدار زیاد بر روی ویژگیهای ظاهری متون مانند استایل و گرامر تکیه میکردند و با انجام آموزشهایی که در بالا به اونها اشاره شد، آگاهتر شدند و برای تشخیص به ویژگیهای محتوایی و معنایی نیز توجه بیشتری کردند و از لایه ظاهری برای تشخیص عبور کردند( که البته این عبور خیلی موفقیتآمیز نبود همونطور که گفتیم!)
در نهایت هم چندتا پیشنهاد برای محققان حوزه NLG دارند که باید سرلوحه کار خودشون قرار بدهند. اول اینکه، نتایج تست انسانی مدلهاشون رو سعی کنند با چارچوب معرفی شده گزارش کنند. دوم اینکه در ارزیابیهای انسانی از لایه ظاهر عبور کنند و توجه بیشتری به معنا و مفید بودن متن بکنند. مثلا یک تست جذاب برای این موضوع این است که از ارزیابیکننده درخواست کنند تا در ادامه متن داده شده، متنی را بنویسند و توانایی همراهی ارزیابیکننده با متن را اندازهگیری کنند. همچنین از ارزیابی متنهای کوتاه عبور کرده و به سمت متنهای طولانیتر بروند.
این پیشنهادها به طور ضمنی چالشهای بعدی حوزه NLG رو هم مشخص میکنند. بههمین خاطر توصیه میکنیم این مقاله رو حتما اگر نمیخونید حداقل یه نگاه بهش بندازید خداوکیلی!
لینک مقاله:
https://arxiv.org/abs/2107.00061
پ.ن.۱: به عکس دقت کنید! به نظرتون کدومش کار ماشینه؟ ☺️
پ.ن.۲: جا داره یه نگاه دوباره به این پست از کانال بندازید که بررسی مقالهی برندهی ACL2020 بود و اون هم روی یک نگاه دیگه از ارزیابی مدل تکیه کرده بود:
https://t.me/nlp_stuff/48
#read
#paper
@nlp_stuff
Post #199
2.7K