#новости
👨💻 Google релизнули EmbeddingGemma
Это открытая модель для эмбеддингов, основанная на Gemma 3. Ее основная фишка – размер. Крошка имеет всего 308M параметров и показывает SOTA метрики в весе до 500М. Работает более чем на 100 языках.
А еще модель специально оптимизирована для использования on-device, то есть локально без Интернета. С квантизацией требует всего 200MB оперативки.
Зачем нам эмбеддинг-модель в режиме on-device? Например, для приватного RAG или semantic search. Модель работает локально, то есть и генерация векторов для поиска, и сам поиск проходят прямо на устройстве. Это быстрее, дешевле и без риска утечки данных.
Кстати, эмббединги на выходе могут быть разных размерностей, от 768 до 128. Это прикольная особенность. Работает такое за счет Matryoshka Representation Learning. Если кратко, модель эластична, то есть внутри нее есть полностью самодостаточные модели поменьше. Переключение между ними и позволяет на лету менять размерности выходных векторов.
Потыкать модельку уже можно в sentence-transformers, llama.cpp, MLX, Ollama, LiteRT, transformers.js, LMStudio, Weaviate, Cloudflare, LlamaIndex и LangChain. Как видите, с интеграциями у Google все в порядке
👉Новости 👉База вопросов
Post #370
122



- ❤ 1