TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #913 2.1K
🔥 model2vec — реализация модели для обучения эмбедингов (embeddings) нейросетевых моделей. Основная идея проекта — создание представлений моделей, которые могут быть использованы для оценки схожести между моделями, их кластеризации или других задач.


Model2Vec - библиотека для создания компактных и быстрых моделей на основе предобученных Sentence Transformer моделей.

Model2Vec позволяет создавать эмбединг-модели слов и предложений, которые значительно меньше по размеру, но при этом сопоставимы по производительности с исходными Sentence Transformer моделями.

Отличительные особенности:

🟢быстрая дистилляция, процесс создания модели занимает несколько минут;

🟢быстрый инференс, в 500 раз быстрее на CPU относительно родительской модели;

🟢BYOM и BYOV, можно использовать на любой Sentence Transformer модели с любым словарем;

🟢мультиязычность, все что нужно - только мультиязычная модель в качестве источника;

🟢интеграция с Huggingface, загрузка\выгрузка моделей привычными from_pretrained и push_to_hub.

Пайплайн Model2Vec трехэтапный. На первом этапе словарь пропускается через модель Sentence Transformer для получения векторов эмбедингов для каждого слова.

Далее, размерность полученных эмбеддингов сокращается с помощью метода главных компонент (PCA). Наконец, применяется zipf-взвешивание для учета частотности слов в словаре.

Model2Vec работает в двух режимах:

🟠Output, в котором модель работает подобно Sentence Transformer, используя subword токенизацию;

🟠Vocab, в котором создается набор статических эмбедингов слов, аналогично GloVe или Word2Vec.

Оценку производительности Model2Vec делали на наборе данных MTEB на задачах PEARL (оценка качества представления фраз) и WordSim (оценка семантической близости слов).

Результаты показывают, что Model2Vec превосходит по производительности GloVe и модели, основанные на WordLlama по всем задачам оценки.


🌟 Репозиторий предоставляет набор инструментов и инструкций для работы с этими представлениями, включая подготовку данных, обучение и использование. В нем также есть примеры использования и инструкции по запуску.

▪️GitHub

@bigdatai
  • 👍 8
  • ❤ 3
  • 🔥 2
  • ✍ 1
More from @bigdatai
  1. Oct 10, 2026🤖 Зачем вызывать большую LLM, если агенту нужно просто выбрать «да» или «нет»? Phocinae-L…
  2. Oct 8, 2026Хватит переписывать промпты: что такое harness engineering Почему ИИ-агенты ломаются даже…
  3. Oct 8, 2026ChatGPT PRO - полный курс на русском Практический курс по ChatGPT: от первого промпта до а…
  4. Oct 7, 2026Свежие данные из интернета для ИИ-агента - одним вызовом API Чтобы ИИ-ассистент отвечал с…
  5. Oct 6, 2026Яндекс открыл YTsaurus Flow: 100+ ГБ/с в реальном времени без потерь и дублей Технология о…
  6. Oct 6, 2026Claude и вопрос сознания: что не так с конституцией модели Разбор критики конституции Clau…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →