تا حالا فکر کردید وقتی به هوش مصنوعی میگید «تعمیر لاستیک»، چطور مقالهای درباره «پنچرگیری چرخ» رو پیدا میکنه در حالی که حتی یک کلمه مشترک هم ندارن؟
این جادوی جستوجوی معنایی (Semantic Search) و پشت صحنهاش، مفهومی به نام Embedding هست.
کامپیوترها هیچ درکی از کلمات ندارن و فقط اعداد رو میفهمن. پس چطور باید متن رو پردازش کنن؟
به جای اینکه کلمات رو به عنوان نمادهای مجزا ببینیم، اونها رو به نقاطی در یک «فضای برداری» (Vector Space) تبدیل میکنیم.
فرض کنید زبان یک کشور پهناوره و هر کلمه یا مفهوم، یک «شهر» در این کشوره. امبدینگ در واقع سیستم مختصات جغرافیایی این شهرهاست.
🔹 شهرهایی که فرهنگ مشابهی دارن (معنای نزدیک)، در همسایگی هم قرار میگیرن.
🔹 مفاهیم بیربط، در دو قطب مخالف این کشور هستن.
وقتی مدلهایی مثل Sentence-BERT (SBERT) روی متن آموزش میبینن، یاد میگیرن که کلمات با بافت (Context) مشابه، مختصات ریاضی مشابهی داشته باشن.
حالا چطور بفهمیم دو جمله به هم ربط دارن؟
اینجاست که «شباهت کسینوسی» (Cosine Similarity) وارد بازی میشه. به جای اینکه اندازه بگیریم دو شهر چند کیلومتر با هم فاصله دارن، زاویه قطبنمای مسیر رسیدن به اونها رو مقایسه میکنیم.
چرا؟ چون طول بردار ممکنه صرفاً نشوندهنده طول متن باشه، اما زاویه بردارها (جهت اونها در فضا) نشوندهنده «محتوا و معنای» واقعی هست.
⚠️ یک اشتباه معروف:
حتماً فرمول King - Man + Woman = Queen رو شنیدید که میگن هوش مصنوعی باهاش کلمات رو جمع و تفریق میکنه! واقعیت ماجرا اینه که این بیشتر یک تمایل هندسی زیباست تا یک ماشینحساب دقیق. در خیلی از مدلهای واقعی، نزدیکترین بردار به نتیجه این تفریق، همچنان خود کلمه King هست و این ادعا در رسانهها اغراق شده.
🎯 چرا این مفهوم امروزه انقدر مهمه؟
دلیل اصلی اینکه چتباتهای سازمانی میتونن از روی PDFهای داخلی شرکت به شما جواب بدن، معماری RAG (تولید افزوده به بازیابی) هست.
در RAG، اسناد متنی به بردار تبدیل شده و در پایگاهدادههای برداری (Vector Databases) ذخیره میشن. وقتی شما سوالی میپرسید، سیستم به جای تطبیق کلمه به کلمه (مثل Ctrl+F)، به دنبال نزدیکترین «مفهوم» در این فضای چندبعدی میگرده.
البته امبدینگها معنای کلی رو حفظ میکنن اما ممکنه جزئیات دقیق مثل اعداد، تاریخها یا کدهای خطا رو در این فضای پیوسته گم کنن. به همین دلیل در ترندهای جدید، تکنیکهایی مثل Matryoshka Embeddings اومدن تا با حفظ معنا، ابعاد بردار رو برای جستوجوی سریعتر کاهش بدن.
در نهایت، امبدینگها معنای انسانی رو نمیفهمن، بلکه فقط الگوهای آماری همنشینی کلمات رو در یک فضای ریاضی فشرده میکنن؛ اما همین ترجمه معنا به هندسه، ستون فقرات هوش مصنوعی مدرن رو ساخته.🚀
اگه میخوای عمیقتر بشی، این دو منبع رو از دست نده 👇
🔗 دوره جامع متخصص علم داده و یادگیری ماشین در وبسایت دیتایاد
🔗 دوره آموزش جامع LLM و NLP در وبسایت دیتایاد
🔗 Getting Started With Embeddings
🔗 Vector Similarity Explained
📌مرجع تخصصی هوش مصنوعی و علم داده
❇️ سایت | بله | تلگرام | اینستاگرام