ده سال پس از پیروزی تاریخی آلفاگو بر «لی سدول»، قهرمان بازی گو، ثوره گرپل، از اعضای اصلی تیم آلفاگو، میگوید هوش مصنوعیهای امروزی هنوز از سازوکاری که آن پیروزی را ممکن کرد برخوردار نیستند.
در سال ۲۰۱۶، آلفاگو در بازی دوم مقابل لی سدول حرکت شماره ۳۷ را انجام داد؛ حرکتی چنان غیرعادی که برخی تصور کردند با یک خطای برنامهنویسی روبهرو هستند. شبکه عصبی آلفاگو احتمال میداد یک بازیکن حرفهای تنها با احتمال حدود یک در ۱۰ هزار چنین حرکتی انجام دهد. بااینحال آلفاگو آن را انتخاب کرد و بازی را برد.مطالب بیشتر
بهگفته گرپل، این حرکت محصول «شهود» صرف نبود، بلکه نتیجه استدلال بود. آلفاگو از دو بخش اصلی تشکیل میشد: شبکهای که حرکات امیدوارکننده را پیشنهاد میکرد و سامانه جستوجویی که هزاران آینده احتمالی بازی را در قالب یک درخت بررسی میکرد. شبکه عصبی حدس میزد و جستوجو پیامدهای آن حدس را میسنجید.
این معماری به تقسیمبندی مشهور دنیل کانمن شباهت داشت: «سیستم ۱» سریع، شهودی و تداعیگر است و «سیستم ۲» آهسته، مرحلهبهمرحله و سنجیده. در آلفاگو، شبکههای عصبی نقش شهود و جستوجوی درختی نقش تفکر سنجیده را ایفا میکردند.
اما مدلهای زبانی بزرگ امروزی اساساً با پیشبینی پیدرپی توکن بعدی کار میکنند. حتی روش «زنجیره فکر» نیز سازوکار مستقلی برای استدلال ایجاد نمیکند؛ مراحل میانی همچنان توسط همان فرایند پیشبینی توکن بعدی تولید میشوند، فقط مدل پیش از ارائه پاسخ مدت بیشتری این فرایند را ادامه میدهد.
گرپل سه مشکل اساسی را مطرح میکند. نخست اینکه این مدلها معمولاً یک «وضعیت معرفتی» صریح و قابلبازرسی ندارند که نشان دهد چه فرضیههایی را بررسی میکنند، به هرکدام چقدر اطمینان دارند، چه شواهدی در اختیار دارند و چه پرسشهایی هنوز باز مانده است.
دوم، مرز مشخصی میان دانش سیستم و نحوه پردازش آن وجود ندارد؛ دانش و فرایند استدلال در وزنهای شبکه عصبی با یکدیگر آمیختهاند و مجموعه مستقلی از باورها وجود ندارد.
سوم، زنجیرههای فکری تولیدشده لزوماً بازتاب واقعی مسیر رسیدن مدل به پاسخ نیستند. پژوهشها نشان دادهاند مدلها گاهی ابتدا به پاسخی میرسند و سپس توضیحی ظاهراً منطقی برای آن میسازند.
این مسئله در پزشکی، مهندسی و پژوهش علمی اهمیت ویژهای دارد. در این حوزهها فقط پاسخ نهایی مهم نیست؛ باید بتوان فهمید سیستم بر چه شواهدی تکیه کرده، چه فرضهایی داشته و در صورت بروز خطا، دقیقاً کدام مرحله اشتباه بوده است.
گرپل که به همین دلیل از گوگل دیپمایند جدا شده، پیشنهاد میکند سامانههای آینده چیزی مشابه درخت بازی آلفاگو داشته باشند: یک وضعیت معرفتی صریح که مشخص کند چه چیزهایی پذیرفته یا رد شدهاند، چه مواردی مورد تردیدند و چه پرسشهایی همچنان بیپاسخ ماندهاند.
در چنین سیستمی، استدلال شامل تغییر مرحلهبهمرحله این وضعیت بر اساس شواهد خواهد بود: استخراج نتایج، تقسیم مسئله، انجام محاسبه، طرح پرسش و حتی تصمیمگیری درباره آزمایش بعدی. بخشی مستقل نیز باید هر مرحله را ارزیابی کند و تنها زمانی باورهای سیستم را تغییر دهد که شواهد کافی وجود داشته باشد.
از نظر گرپل، بزرگتر کردن مدلهای زبانی الزاماً آنها را به سیستمهای استدلالگر تبدیل نمیکند. افزایش مقیاس میتواند «شهود ماشینی» را قدرتمندتر کند، اما شهود بهتر بهخودیخود به معنای تفکر سنجیدهتر نیست.
برای دستیابی به کشفیات واقعاً تازه در پزشکی، داروسازی، مواد و علوم اقلیمی، به سیستمهایی نیاز داریم که نتیجه آنها حاصل زنجیرهای قابلبازرسی از شواهد، استنتاج و اصلاح باورها باشد؛ نه صرفاً روایتی متقاعدکننده که پس از رسیدن به پاسخ ساخته شده است.
💡اتاق گفتگوی علم و آگاهی
منبع: MIT Technology Review
#هوشمصنوعی
#مدلزبانی
#استدلال
#آلفاگو
