Вышла очередная интересная штука от Facebook, свежак, всего 7 дней назад (надеюсь, вы успеваете читать):
ImageBind: One Embedding Space To Bind Them All
А мы уже успели обкатать модельку для изображений на наших задачах, в стиле zero-shot metric learning.
Вышло сильно хуже, чем специализированные энкодеры и чуть-чуть хуже, чем blip2. Но заметно лучше, чем blip1 или clip (на ViT).
Тем не менее, применений у подхода огромное количество и это лишь одно из них. Так что не сомневаюсь - он займёт в нашем ящике для инструментов достойное место.
Post #9
245
- 😎 5
- 🔥 2