حالا اما تو سال ۲۰۱۲ چندتا چیز تغییر کرده بود که به نظر هینتون میتونست منجر به یک نتیجه متفاوت بشه.
اگر بخوایم از یک آنالوژی مناسب استفاده کنیم، شاید ایجاد آتش خوب باشه.
برای اینکه آتش ایجاد بشه ما به سه چیز نیاز داریم: گرما، اگسیژن و سوخت.
و دقیقا به همین شکل برای اینکه بتونیم یک مدل هوش مصنوعی رو به خوبی آموزش بدیم یا تولید کنیم به الگوریتم، مقدار زیادی داده و سختافزار مناسب نیاز داریم.
اینکه شبکههای عصبی برای چندین دهه جواب نمیدادن به این خاطر بود که نه سختافزار مناسبی وجود داشت و نه مقدار دادهها زیاد بود و به همین خاطر این ایده تا قبل از دهه ۲۰۰۰ عملا کنار گذاشته شده بود و شرکتها به سراغ الگوریتمهای دیگهای رفته بودن و به جای اینکه یک شبکه عصبی رو آموزش بدن، قوانین رو بیشتر به صورت دستی داخل کد به مدل میدادن.
مثلا فرض کنید یک مدل تصویری دارید که میخواید گربهها رو تشخیص بده. به جای اینکه عکس گربهها رو بهش بدید تا خودش آموزش ببینه بهش میگید که یک گربه چه ویژگیهایی داره تا طبق اون گربهها رو تشخیص بده.
طبیعتا جفری هینتون با این ایده مخالف بود و عقیده داشت که میشه با تقلید از هوش انسانی این مسئله رو بهتر حل کرد اما حرفش در اون زمان خریداری نداشت.
در واقع طرفداران شبکههای عصبی مثل هینتون مثل کسانی بودن که میخوان آتیش درست کنن اما فقط بلدن جرقه ایجاد کنن و نه سوخت دارن و نه اکسیژن به مقدار کافی در دسترسه.
تا اینکه تو سال ۲۰۰۶ یک استادیار دانشگاه پرینستون به اسم فی-فی لی (Fei-Fei Li) به این نتیجه رسید که به جای بهینهسازی الگوریتمها بهتره که تمرکز رو روی فراهم کردن دادههای بیشتر بذاره و با استفاده از مکانیکال ترک آمازون و برونسپاری تونست تا سال ۲۰۱۰ حدود یازده میلیون عکس تو ۱۵ هزار دستهبندی مختلف تهیه کنه و در دسترس عموم قرار بده و در کنار اون یک مسابقه هم به راه انداخت تا گروههای مختلف بر اساس دقت تشخیص تصویر الگوریتمهاشون رتبهبندی بشن و به این شکل ImageNet متولد شد.
در واقع فی فی لی مقادیر بسیار زیادی اکسیژن تولید کرده بود.
سال ۲۰۱۰ که اولین دور رقابتها با ۱۲ تیم برگزار شد، بهترین مدل تونست درصد دقت ۷۱٫۸ درصدی ارائه بده. سال ۲۰۱۱ اما تعداد تیمهای شرکتکننده کمتر بود و بهترین مدل با بهبود ۲٫۴ درصدی تونست دقت ۷۴٫۲ درصدی داشته باشه.
و اینجا بود که جفری هینتون و تیمش وارد داستان شدن.
ایده اونها این بود که با پردازش موازی، حالا سوخت کافی برای به راه انداختن یک آتش تمام عیار آماده شده و میشه با چندتا جیپییو یک شبکه عصبی رقابتی رو آموزش داد که نتیجه بهتری داشته باشه و تو رقابت خودش رو نشون بده.
الکس کریژوسکی و ایلیا ساتسکور هم با فاند ۱۰۰۰ دلاری که داشتن رفتن ۲ تا جیپییو GTX 580 خریدن و آخر هفته الکس شروع به کار روی آموزش شبکه عصبی با دادههای ImageNet کرد و اسم مدل خروجی هم شد AlexNet.
سال ۲۰۱۲ الکسنت با بهبود ۱۰٫۵٪ تونست دقت ۸۴٫۷ درصدی ارائه بده و با حدود ۱۵٪ خطا یک پیشرفت عجیب به حساب میومد. اونقدر عجیب که تقریبا کسی باورش نمیشد.
فرض کنید تو مسابقه دو صدمتر که همه روی صدم ثانیهها برای شکستن رکورد رقابت میکنن، یک نفر با یک ثانیه اختلاف بیاد و رکورد رو جابجا کنه.
در واقع الکسنت کار جدیدی نکرده بود. فقط از تمام چیزهایی که از قبل کم کم فراهم شده بود و وجود داشت استفاده کرد و به دنیا نشون داد که شبکههای عصبی دیگه ایدههای دور از دسترس و فانتزی نیستن و همه چیز برای این ایده مهیا شده. حالا هم دادههای زیادی وجود داشت و هم جیپییوهای انویدیا به راحتی در دسترس بودن و از همه مهمتر: کاری که قبلتر به ۳۰۰ سیپییو یا بیشتر نیاز داشت که فقط شرکتهای خیلی بزرگ میتونستن تامینش کنن حالا تو اتاق یک دانشجوی کامپیوتر با دو تا جیپییو انجام شده بود!