Ответим расширенно на два заданных вопроса по проекту поиска моментов в видео, т.к. Марине не хватило времени оффлайн.
1. Можно ли использовать LLM подход для детекции моментов. Например, при помощи подхода из Large World Models.
Да, конечно. Но данная конкретная модель решает совсем другие задачи и с поиском моментов не справляется.
Кроме того, авторегрессионный 7B трансформер из World Model находится в противоположной весовой категории с нашим энкодерным трансформером на 12.5М параметров.
Если же рассуждать теоретически, про какие-то другие бейзлайны или разработку своего, то главными препятствиями на пути будут два факта: недостаток подходящих данных и, всё также, вычислительный бюджет.
Видео - безумно дорогой и тяжёлый формат и наше решение призвано хотя бы немного компенсировать этот факт, т.к. разрабатывалось для промышленного применения.
В общем, по сути, тут тот же выбор с теми же плюсами и минусами, что и в случае специализированных моделей vs MLLM. Мы как раз недавно исследовали этот вопрос (пост первый, пост второй).
2. А вы не пробовали тренироваться при помощи данных из Youtube? Огромная выборка уже размечена с наиболее популярными кусками, где кликают и пересматривают. Если убрать рекламу, где все перелистывают, останется самое интересное.
Какое-то время назад очень хотели и надеялись на этот вариант. К сожалению, при углублённом изучении вопроса он отпал. Это очень шумная разметка, там дело далеко не только в рекламе. Факторов множество. Например, зрители прыгают по топикам, которые сами авторы разметили в своём видео и создают ложные волны хайлайтов, или пересматривают те участки, где что-то объясняется, но не показывается, или объясняется и показывается, но что-то сложное, что требуется смотреть много раз, или пересматривают участок, где неразборчивая речь. В общем, почему люди только не перематывают. Что-то из этого можно вычистить, но не всё, и получить чистые результаты пока показалось малоперспективным.
Post #95
630
- ❤ 9