یکی از جوابهای کلاسیک، قضیه تقریب جهانی است.
(Universal Approximation Theorem)
این قضیه به زبان ساده میگه:
یک شبکه عصبی با فقط یک لایه پنهان، اگر بهاندازه کافی نورون داشته باشه و تابع فعالساز مناسبی استفاده کنه، میتونه هر تابع پیوستهای رو روی یک ناحیه محدود، با هر دقتی که بخوای تقریب بزنه.
Cybenko
در ۱۹۸۹ یکی از نتایج معروف این ایده رو برای توابع فعالساز سیگموئیدی ثابت کرد و Hornik و همکاران هم همان سال چارچوب عمومیتری برای شبکههای پیشخور ارائه کردند.
برای یک تابع پیوسته مثل f روی یک مجموعه فشرده، ایده اینه که میشه ترکیبی از این جنس پیدا کرد:
F(x) = Σ αᵢ σ(wᵢ·x + bᵢ)
طوری که اختلاف F(x) و f(x) روی کل ناحیه موردنظر، هرقدر بخوای کوچک بشه. یعنی برای هر ε مثبت، میشه شبکهای ساخت که خطای تقریبش از ε کمتر باشه.
مثلاً فرض کنید تابعی داریم که ورودیاش دما، فشار و رطوبته و خروجیاش مصرف انرژی. لازم نیست از قبل فرمول دقیق این تابع رو بدونیم؛ قضیه میگه در شرایط مناسب، یک شبکه عصبی میتونه تابعی بسازه که خروجی اون تابع اصلی رو هرقدر بخوای دقیق تقریب بزنه.
از نظر ریاضی، حرف قضیه خیلی شبیه اینه که خانوادهای از توابع شبکه عصبی در فضای توابع پیوسته، چگال باشه؛ یعنی هر تابع پیوستهای رو بشه با اعضای این خانواده به دلخواه نزدیک کرد.
اما یک نکته مهم: قضیه نمیگه شبکه حتماً یاد میگیره، نمیگه چقدر داده لازم داره، نمیگه آموزش چقدر طول میکشه و حتی نمیگه چند نورون لازم داریم. فقط میگه چنین شبکهای وجود دارد.
همین تفاوت کوچیک خیلی مهمه:
«توانایی تقریبزدن» با «توانایی پیدا کردن اون تقریب در عمل» یکی نیست.
برای همین قضیه تقریب جهانی بیشتر از اینکه پاسخ مسئله آموزش باشه، یک نتیجه درباره ظرفیت نمایش شبکه عصبیه.
یکی از پایههای نظری موفقیت شبکههای عصبی، از یک سؤال کاملاً ریاضی شروع میشه: یک خانواده از توابع، تا چه حد میتونه توابع دیگر رو تقریب بزنه؟