Google выпустила мультимодальную EmbeddingGemma 2
Первая версия работала только с текстом, вторая построена на Gemma 4 и переводит в одно векторное пространство текст, код, изображения, видео и аудио. Так что на вход теперь можно подавать и смешанные данные.
Модель весит 740M параметров, но устроена модульно. Текстовая часть занимает 270M, а энкодеры изображений и аудио загружаются отдельно при необходимости. Контекст вырос до 8K токенов, это около 5,5 минут аудио или 29 картинок за раз.
На текстовых задачах качество осталось на уровне первой версии, а на коде заметно выросло. Google заявляет, что среди мультимодальных эмбеддеров до 1B параметров это лучший результат.
Веса открыты под Apache 2.0.
https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/
Post #10110
13.7K

- ❤ 61
- 🔥 29
- 👍 14
- ⚡ 1
- 🕊 1
- 🎄 1