Post #127
5.18K

У нас отличные новости! 🔥🔥🔥
Сегодня была опубликована наша исследовательская работа: "Saliency-Guided DETR for Moment Retrieval and Highlight Detection". В ней мы предлагаем новый способ поиска ключевых моментов в видео релевантных текстовым запросам пользователей. Это было захватывающее приключение, полное вызовов и открытий, и теперь мы рады поделиться результатами с вами! 🥱🌿
Основные моменты нашей работы:
1. Saliency Guided Cross-Attention модуль
В рамках исследования мы разработали уникальный модуль, который эффективно объединяет признаки видеоклипов и пользовательских запросов, обеспечивая невероятное качество сопоставления ⏹
2. Гибридный детектор
Для эффективного решения задачи поиска моментов мы объединили гибкость современных фундаментальных видео энкодеров и точность гибридных DETR-like детекторов 🧑🎓
3. Фреймворк для генерации претрейн датасета
Во время нашего исследования мы столкнулись с важной проблемой: существенный дефицит данных для обучения модели. Поэтому мы разработали собственный метод автоматической разметки, и модель, обученная на полученных данных, показала результаты близкие к SOTA в zero-shot режиме, что стало для нас особым поводом для гордости 😎
Наша модель SG-DETR демонстрирует SOTA метрики на всех ключевых бенчмарках: Charades-STA, TACoS, TVSUM и YouTube Highlights. Особо впечатляющим стал результат на главном бенчмарке QVHighlights, где модель опередила предыдущее решение с невероятным гэпом в 7.44 п.п. 🌿🌿🌿
Препринт версия работы доступна на arXiv и PwC. И уже совсем скоро опубликуем в открытый доступ код, веса модели и наш датасет. Будем рады вашим отзывам и комментариям! 📚
Сегодня была опубликована наша исследовательская работа: "Saliency-Guided DETR for Moment Retrieval and Highlight Detection". В ней мы предлагаем новый способ поиска ключевых моментов в видео релевантных текстовым запросам пользователей. Это было захватывающее приключение, полное вызовов и открытий, и теперь мы рады поделиться результатами с вами! 🥱🌿
Основные моменты нашей работы:
1. Saliency Guided Cross-Attention модуль
В рамках исследования мы разработали уникальный модуль, который эффективно объединяет признаки видеоклипов и пользовательских запросов, обеспечивая невероятное качество сопоставления ⏹
2. Гибридный детектор
Для эффективного решения задачи поиска моментов мы объединили гибкость современных фундаментальных видео энкодеров и точность гибридных DETR-like детекторов 🧑🎓
3. Фреймворк для генерации претрейн датасета
Во время нашего исследования мы столкнулись с важной проблемой: существенный дефицит данных для обучения модели. Поэтому мы разработали собственный метод автоматической разметки, и модель, обученная на полученных данных, показала результаты близкие к SOTA в zero-shot режиме, что стало для нас особым поводом для гордости 😎
Наша модель SG-DETR демонстрирует SOTA метрики на всех ключевых бенчмарках: Charades-STA, TACoS, TVSUM и YouTube Highlights. Особо впечатляющим стал результат на главном бенчмарке QVHighlights, где модель опередила предыдущее решение с невероятным гэпом в 7.44 п.п. 🌿🌿🌿
Препринт версия работы доступна на arXiv и PwC. И уже совсем скоро опубликуем в открытый доступ код, веса модели и наш датасет. Будем рады вашим отзывам и комментариям! 📚
- ❤ 3
- 👍 2
- ❤🔥 1
- 🔥 1












