Как мы построили сервис по поиску видео контента с помощью текста 🙈
Мы командой решили написать новую статью на Habr про то, как мы создали сервис по поиску видео контента с помощью картинки - задача Text2Video Retrieval. Грубо говоря, пользователь вводит текст «собака гуляет на берегу моря», и сервис с помощью магии ИИ должен найти видео, где показано, как собака гуляет на берегу моря 🤩Кратая суть решения состоит в том, что 💪
1️⃣ Мы собрали в БД короткие ролики
2️⃣ Описали скрины из роликов с помощью vision-language model, а QWEN-VL
3️⃣ Пользователь вводит текст «морской пейзаж при закате».
4️⃣ Encoder превращает этот текст в вектор.
5️⃣ Сервис сравнивает этот вектор с векторами из базы данных с помощью ANN.
6️⃣ Пользователь получает релевантные видео текстовому запросу.
Статья написана простыми словами, с множеством картинками с пояснениями, поэтому она мега понятная для новичков, и её может почитать даже человек не в IT 🥇
Итог:
Предлагаю вам почитать статью, буду благодарен, если оцените её знаком вверх. Мне важно от вас услышать фидбек и рекомендации по написанию других статей.
