TGViewer
NLP stuff NLP stuff @nlp_stuff · 3.86K subscribers
Post #138 1.58K
نورون‌های عصبی Multi-Modal زیر ذره‌بین OpenAI Microscope!

چند روز پیش مقاله‌ای با نام Multimodal Neurons in Artificial Neural Networks از تیم OpenAI منتشر شد. این مقاله میاد نشون میده که یک نورون در مدلی multi modal مثل CLIP داره به یک کانسپت و مفهوم (انسان، درخت، احساسات و ...) واکنش میده و فعال میشه وقتی اون مفهوم چه به صورت عکس، چه به صورت متن یا چه به صورت نقاشی باشه. این موضوع قبلا هم توسط bioکارها راجع به نورون طبیعی گفته شده بود (ما چه کلمه درخت را بخونید، چه عکس درخت ببینید چه نقاشی درخت نشونمون بدهند، می‌تونیم همشون را به مفهوم درخت مرتبط کنیم).
مثلا اومدند دیدند که یه نورون هست که چه عکس یارویی که لباس مرد عکنبوتی پوشیده، چه نقاشی مرد عنکبوتی یا چه کلمه‌ی spider ببینه پاسخ میده و فعال میشه؛ یعنی یه نورون کلا به کانسپت spider man (چه تصویر چه نقاشی چه کلمه) پاسخ میده. پس این مدل Multi-Modal تونسته جنبه‌های مختلف از یک مفهوم را به هم ربط بده. دو تا چیز جالبه اینجا: اول اینکه مدله این ارتباط را تونسته ایجاد کنه. دوم اینکه اینا چقدر قشنگ اینو بررسی کردند. کیف کنیم!
بعد هم اینا اومدند نورون‌های مختلف برای مفاهیم مختلف مثل Region, Person, Emotion, Holiday, Color و ... را پیدا کردند و به نمایش گذاشتند. چجوری؟ OpenAI یه ابزاری به نام Microscope درست کرده (متاسفانه این یکی از زیر دستمون سر خورده و توی کانال نگذاشتیم) که نورون‌های لایه‌های مدل‌های معروف تصویری مثل AlexNet ،ResNet ،Inception ،VGG و CLIP را به تصویر کشیده تا بشه تفسیرشون کرد. برای اینکار اومدند عکسایی که نورون موردنظر یا اون کانال تصویری مدنظر را خیلی فعال کردند، یه جا جمع کردند و از سمتی تصاویر ورودی از دیتاست ImageNet که اون نورون‌ها را فعال کردند هم آوردند؛ مثلا میشه دید که همبرگر و پنکیک فلان نورون از فلان لایه را خیلی فعال می‌کنه. حالا اومدند نورون‌های لایه‌های مختلف مدل CLIP هم با همین روش بررسی کردند و برای مفاهیم مختلف نورون‌هاشون را آوردند. و اینکه برای هر کدوم از مفاهیم هم اومدند نشون دادند که چه تصاویر صورتی، چه متونی، چه معماری‌هایی، چه مناظری و... نشون دهنده‌ی اون مفهوم برای این نورونه و اون نورون را فعال می‌کنه. مثلا می‌تونید ببینید که این مدل، «آمریکا» را با چه چیزایی می‌تونه تشخیص بده یا مثلا «ترامپ» را با چه چیزایی یا مثلا مفهوم «خوشحال» را با چه چیزایی!

لینک ویدیوی توضیح مقاله:
https://youtu.be/Z_kWZpgEZ7w

لینک مقاله که کلی مثال خفن هم در این صفحه آوردند که باهاشون ور برید لذت ببرید:
https://distill.pub/2021/multimodal-neurons/

پ.ن. زکات لذت از این پست، نشر آن است! :)
#read
#paper
#watch

@nlp_stuff
Telegram stuff
More from @nlp_stuff
  1. Jan 6, 2026اندر حکایات بازی با کلمات: AI Engineering vs ML Engineering/Data Scientist این روزها عناوی…
  2. Mar 3, 2025مفهوم Agent چیست و چگونه کار می‌کنند؟ خانم چیپ هوین بلاگ پست مفصلی راجع به Agent (به قول ر…
  3. Feb 28, 2025خلاصه‌تر فکر کن از اونجایی که در مسائل استدلالی (reasoning) ، مدل برای رسیدن به جواب نهایی…
  4. Feb 23, 2025چه قدر تا بی‌کارشدن بک‌اندی‌ها فاصله داریم؟ عمده استفاده برنامه‌نویس‌ها از LLM‌ها در سطح پ…
  5. Feb 20, 2025به سوی سیستم‌۲ پیشرفت‌های هوش مصنوعی در دهه ۲۰۱۰، مدیون آموزش مدل‌های بزرگ دیپ لرنینگی روی…
  6. Feb 8, 2025مدل‌های استدلالی (reasoning) چیست و چگونه ساخته می‌شوند؟ حتما این روزها بارها مدل‌های استد…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →