🏢 EmbeddingGemma 2: мультимодальный поиск прямо на телефоне
Google выпустила EmbeddingGemma 2 — открытую модель для эмбеддингов на 740M параметров. Она переводит текст, код, картинки, видео и аудио в одно векторное пространство. Проще говоря, на устройстве можно искать фото по фразе «кот спит на клавиатуре» или найти нужный момент в видео без расшифровки и подписей. Ещё модель умеет классифицировать без дообучения, и это пригодится для роутинга интентов за миллисекунды.
Запустить её можно уже сейчас через LiteRT и MediaPipe Tasks. А в ближайшие недели модель появится в Google ML Kit с ускорением на NPU и автообновлением, так что тащить её в APK не придётся.
Модель запускается на CPU и GPU везде, где есть LiteRT, то есть на Android, iOS, macOS, Windows, Linux, в вебе и даже на Raspberry Pi 5. NPU используется там, где он есть. Модель модульная, поэтому можно выбрать вариант под устройство:
👉 только текст весит 165 МБ
👉 текст с картинками — 388 МБ
👉 полная версия — 485 МБ
Google опубликовал замеры на Pixel 11 Pro, Galaxy S26 Ultra и iPhone 18 Pro: на флагманах эмбеддинг текста считается за 8–42 мс, а текста с картинкой — за 49–191 мс.
Минимальную версию Android и список поддерживаемых устройств Google не называет, а на бюджетных телефонах замеров нет, так что их лучше проверить самостоятельно.
⚠️ Важно для Беларуси и России: если встроить модель в приложение через LiteRT или MediaPipe, она будет работать везде. Лицензия Apache 2.0 регионы не ограничивает, а модель считает всё на устройстве и к серверам Google не обращается. С ML Kit пока неясно. Vодель будет скачиваться через Google Play services, и про региональные условия Google ничего не написал. Мелким шрифтом в условиях ML Kit GenAI сказано, что сервис нельзя использовать там, где это запрещают экспортные ограничения, и нельзя обходить географические блокировки. Плюс на телефонах без сервисов Google вариант через ML Kit работать не будет.
🔗 Анонс для разработчиков
🔗 Модель и замеры на Hugging Face
#Android #AI #Gemma #AndroidDev
Post #10232
2.39K

- 🔥 29