TGViewer
ML for Value / Ваня Максимов ML for Value / Ваня Максимов @ml4value · 5.69K subscribers
Post #298 5.07K
Ускорение нейронок: квантизация и сжатие эмбеддингов

Нейронные сети становятся все больше, и многие компании задумываются про то, как хранить и инференсить их без GPU-кластера стоимостью 300кк/сек

Тут на помощь нам приходит постпроцессинг эмбеддингов. Стандартный float32 эмбед размерности 1024 можно превратить в int8 (квантизация) или в эмбед размерности, скажем, 128 (сжатие)


Классические способы
Настолько классические, что не знать их на собеседовании миддлу - уже тревожный звоночек

Сжатие делают через PCA / TSNE / UMAP - есть их ускоренные х500 (не преувеличиваю) версии на CUDA. А квантизацию (иногда неявную) и приближенный поиск через библиотеки вроде FAISS. Можно поподробнее про них почитать в недавней статье по сжатию эмбеддингов от wildberries 🍒

Если вы впервые слышите эти названия - очень рекомендую ознакомиться:)


Более современные способы

Можно превращать float32 эмбеддинги в int8 (-128, ..., +127) или даже binary (0, 1) с минорным падением качества
Ребята из Яндекс.Алисы и YaGPT написали годную обзорную статью про квантование в int8

Недавно рисерчеры пошли еще дальше и придумали способ квантования в binary (0, 1)
с ускорением х45 🚀

Для сжатия эмбеддингов придумали Matryoshka Representation Learning - можно «откидывать» части эмбеддинга! Красивое и быстрое решение)

В общем, даешь мир легких нейронок, которые можно запустить на 1 GPU ❤️‍🔥
#articles_review
  • 🔥 23
  • 👍 5
  • 🤷‍♂ 1
More from @ml4value
  1. Sep 17, 2026Post #496
  2. Sep 14, 2026ML вообще работает? (эпизод 1) Давно не писал в канал. Понял, что сейчас сфокусирован на д…
  3. Jun 12, 2026The art of a strong baseline За последнее время все чаще понимаю, что создать сильный бейз…
  4. May 2, 2026Начинать писать после перерыва всегда непросто, поэтому пока легкий пост про мои новости)…
  5. Mar 29, 2026LLM - велосипед в новой обертке Холиварный пост выходного дня) Доля правды в этом есть - и…
  6. Mar 27, 2026LLM долгосрочные интересы пользователя Понемногу LLM-ки находят полезное применение в реко…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →