EmbeddingGemma 2: Google открыла мультимодальные эмбеддинги, работающие на телефоне
Google DeepMind выпустила EmbeddingGemma 2: первую открытую модель эмбеддингов, которая нативно сводит текст, код, изображения, аудио и видео в единое векторное пространство. Модель построена на архитектуре Gemma 4 и использует ту же технологию, что эмбеддеры Gemini. Веса открыты под Apache 2.0.
⚙️ Модульная архитектура. Полная версия весит 740 млн параметров, а для текстовых задач хватает 270 млн: блоки зрения (+170 млн) и аудио (+300 млн) подключаются опционально. Matryoshka-обучение разрешает обрезать векторы с 768 до 128 измерений и экономить до 6 раз хранилища локальной векторной базы.
📱 Работает офлайн на смартфоне. С квантизацией на Google Pixel 11 Pro модели нужно около 191 МБ RAM в текстовом режиме и около 567 МБ в полном мультимодальном. Контекст вырос вчетверо против первой версии: 8K токенов, до 5,5 минуты аудио, 29 изображений или 58 кадров видео за один проход.
🔬 Бенчмарки. На MTEB Code модель поднялась с 68,76 до 78,68 балла против EmbeddingGemma 1. В классе до 1 млрд параметров она лидирует по MTEB, MAEB и MIEB, а отдельные специализированные модели вдвое большего размера обгоняет по качеству.
💼 Зачем это нужно. Локальные эмбеддинги делают поиск приватным: найти момент в видео по голосовой заметке, искать по часам аудиозаписей текстовым запросом, собрать RAG по локальным файлам вместе с Gemma 4. Всё это работает без интернета и не отправляет данные на сервер. Первая EmbeddingGemma собрала более 20 млн скачиваний, поэтому экосистема готова сразу: transformers, MLX, llama.cpp, Ollama, vLLM и файнтюн через Unsloth.
📎 Веса на Hugging Face и Kaggle
📎 Гайд для разработчиков
📎 Модельная карточка с метриками
#Google #Gemma #OpenSource #эмбеддинги
———
@tsingular
Post #8785
1.7K
- 🔥 15
- ✍ 2
- ⚡ 2
- ❤🔥 1
- 🤔 1
- 🤩 1