Google выпустила модель, которая ищет по смыслу в тексте, фото, видео и аудио
EmbeddingGemma 2 - первая открытая модель на 740 млн параметров, которая сразу переводит текст, код, картинки, видео и аудио в одно векторное пространство.
Модель рассчитана на работу на телефоне и ноутбуке, а не только на сервер.
По заявлениям Google, EmbeddingGemma 2 обходит часть специализированных моделей, которые вдвое больше.
Веса уже на Hugging Face.
Post #13481
1.09K