Исследовательская группа опубликовала BVD (Big Video Dataset). Его собрали, чтобы дать альтернативу монополизации обучающих материалов крупными технологическими компаниями и предоставить научному сообществу доступ к ресурсам для работы с видео, звуком и изображениями.
Отправной точкой послужили 1,3 млрд ссылок из архивов CommonCrawl. Из них LAION скачала 80 млн роликов общей длительностью 10 млн часов.
Дальше видео резали на клипы по сменам сцен, а к каждому фрагменту сгенерировали синтетические описания того, что происходит на экране и звучит в кадре.
Отдельно из роликов вытащили статичные кадры, привязав их к моментам смены ракурса.
Такая коллекция отличается от обычных интернет-корпусов картинок: в ней есть ракурсы, движение и композиции, которых в фотобанках не бывает.
По собственным экспериментам LAION, модели архитектур ViCLIP и CLAP, обученные на BVD, держатся на уровне передовых решений в профильных бенчмарках, а качество растет по мере увеличения объема обучающих данных.
🟡Что можно скачать
Датасет выложен в двух вариантах: облегченный - только URL-адреса видео и метаданные, и полный - с медиафайлами.
Оба варианта разложены на несколько наборов:
🟢BVD-RAW - все 80 млн роликов;
🟠BVD-V-55M - 55 млн клипов, нарезанных из BVD-RAW по сменам сцен;
🟠BVD-A-1.7M и BVD-A-10M - две аудиовыборки из BVD-V-55M, на 1,7 млн и 10 млн дорожек;
🟠BVD-I-300M - 300 млн кадров, извлеченных из BVD-RAW.
Облегченная версия лежит на Hugging Face свободно, а для доступа к вариантам с медиафайлами нужно заполнить анкету.
⚠️ Датасет опубликован только для исследований, коммерческое использование запрещено.
@ai_machinelearning_big_data
#AI #ML #Dataset #LAION
