مدل EmbeddingGemma 2 یه مدل جدید Embedding از Google و بر پایه Gemma 4 هست که با مجوز Apache 2.0 منتشر شده. چیزی که این مدل رو از نسل قبلی جدا میکنه اینه که دیگه فقط با text و code کار نمیکنه و میتونه text، code، image، video و audio رو توی یه فضای برداری مشترک قرار بده. یعنی میشه انواع مختلف داده رو کنار هم مقایسه کرد و برای کارهایی مثل جستجوی معنایی و بازیابی اطلاعات ازش استفاده کرد.
یکی از قابلیتهای جالبش اینه که میتونه چند نوع داده رو همزمان پردازش کنه. مثلاً میشه یه متن رو همراه با یه تصویر یا حتی صدا و ویدئو به مدل داد و در نهایت یه embedding مشترک برای همه این اطلاعات گرفت. این ویژگی برای ساخت سیستمهایی مثل multimodal RAG خیلی کاربردیه.
از طرف دیگه، معماری این مدل به شکل modular طراحی شده و لازم نیست همیشه کل مدل 740M پارامتر رو اجرا کنیم. برای مثال، یه نسخه 270M برای text و code وجود داره و با اضافه شدن بخشهای مربوط به تصویر و صدا، نسخههای بزرگتر ساخته میشن. این طراحی باعث شده مدل برای اجرای on-device و لوکال هم مناسب باشه. حتی نسخه کامل مالتی مودال، بعد از quantization، میتونه با حدود 567MB رم روی دستگاههایی مثل Pixel اجرا بشه. از کانتکس ویندو 8k اون هم نباید چشم پوشی کرد.
یه ویژگی مهم دیگه هم Matryoshka Representation Learning (MRL) هست. با این قابلیت میتونیم اندازه embedding رو از 768 تا 512، 256 یا 128 بعد کاهش بدیم و بر اساس نیازمون بین دقت، سرعت و فضای ذخیرهسازی تعادل ایجاد کنیم. این موضوع توی پروژههای بزرگ Vector Search اهمیت زیادی داره و میتونه حجم مورد نیاز برای ذخیرهسازی بردارها رو تا حدود 6 برابر کاهش بده.
در نهایت، چیزی که EmbeddingGemma 2 رو واقعاً جالب میکنه اینه که از یه مدل عمدتاً متنی به یه مدل سبک و مالتی مودال تبدیل شده که میتونه انواع مختلف داده رو توی یه فضای مشترک قرار بده، به شکل modular اجرا بشه و حتی روی دستگاههای نسبتاً محدود هم قابل استفاده باشه. ترکیب این قابلیتها باعث میشه برای ساخت سیستمهای local search، multimodal RAG، Vector Database و AI agentها انتخاب خیلی خوبی باشه.
https://huggingface.co/google/embeddinggemma-2
@DevTwitter | <Reza Jafari/>
Post #13479
1.33K

- ❤ 10
- 👍 1
- 🍌 1