На прошлой неделе в дайджесте HuggingFace я коротко упоминал LocateAnything-3B от NVIDIA — а теперь она вышла на первое место в трендах HuggingFace, так что стоит остановиться подробнее.
Это маленькая модель на 3B, которая находит объекты на картинке по текстовому описанию. Просите «обведи все красные машины» или «покажи, где кнопка отправки» — она ставит рамки и точки. Умеет открытую детекцию, плотную детекцию в захламлённых сценах, точки по описанию, GUI-элементы и текст на изображении. Внутри связка из зрительного энкодера MoonViT и языковой Qwen2.5-3B.
Главная фишка в Parallel Box Decoding. Обычные модели генерируют координаты рамки токен за токеном, как текст. LocateAnything предсказывает всю рамку целиком за один параллельный шаг, отсюда прирост скорости до 2,5 раза без потери геометрии. Режимов три: быстрый параллельный, медленный авторегрессионный и гибридный с откатом на медленный, если разметка вышла кривой.
Обучали на 12 млн картинок и 138 млн запросов, и модель уже работает в проде — встроена в NVIDIA Nemotron 3 Nano Omni как модуль зрения и работы с GUI. Держит картинки до 2,5K и промпт до 24K токенов.
Лицензия NVIDIA только под некоммерческое использование, для исследований, так что аккуратнее если будете светить наружу, что эту модель используете. Веса, демо и код лежат на HuggingFace.
@neuro_channel
Post #2423
2.79K

- ❤ 7
- 🍌 2
- 🤩 1