Нещодавно Google представив другу версію ембеддінгів — Gemini Embedding 2, які є мультімодальними.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-embedding-2/
Ця модель може працювати з
- текстами (пітримується великий контекст до 8192 токенів)
- зображеннями (png/jpeg, до 6 за один запит)
- відео (до 120 сек mp4/mov)
- аудіо (без промежуточного перетворення в текст)
- та PDF-документами (до 6 сторінок довжиною).
В один запит можна кидати різні дані, наприклад, текст + зображення, та все це буде перетворюватись в один вектор. Дуже потужно!
Також гугл порівнює модель з конкурентами по продуктивності, та каже, що вони перші в усіх листингах!
Просте демо семантичного пошуку від гугла:
https://findmemedia.lmm.ai/
Post #5805
2.66K

- ❤ 8