گوگل از EmbeddingGemma 2 رونمایی کرده؛ مدلی که برخلاف LLM هایی مثل ChatGPT قرار نیست باهات چت کنه یا جواب متنی تولید کنه. کار اصلیش اینه که متن، تصویر، صدا و ویدیو رو به یک نمایش عددی به اسم Embedding تبدیل کنه؛ به زبان ساده، محتوای پیچیده رو به شکلی تبدیل میکنه که کامپیوتر بتونه معنی و شباهت بین محتواها رو بهتر درک کنه.
مثلاً فرض کن هزاران PDF، مقاله یا سند داری و کاربر میپرسه چطور فاکتور قبلیم رو دانلود کنم؟. EmbeddingGemma 2 سوال رو به یک بردار عددی تبدیل میکنه و بین اسناد موجود میگرده تا محتواهایی که از نظر معنایی بیشترین ارتباط رو دارن پیدا کنه؛ حتی اگر کلمات دقیقاً یکسان نباشن.
نکته جذابتر اینه که قابلیتهای مدل فقط به متن محدود نمیشن. EmbeddingGemma 2 میتونه متن، تصویر، صدا و ویدیو رو در یک فضای مشترک قرار بده.
blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2
@Linuxor
Post #5591
4.05K