Вдогонку к прошлому посту про зачаточный уровень physical reasoning у VLM-ок и то, почему AGI еще не здесь.
Недавно я пропустил, как Vladlen Koltun (там еще были Yann LeCun и Jitendra Malik) рассказывал про «On Spatial Cognition in Frontier Models» в ETH, и очень обидно, что я все пропустил (энивей, ссылка тут, советую посмотреть). Его поинты — это на самом деле хорошая иллюстрация того, где вообще находится лимит у VLM в физических задачах, что я упоминал ранее.
Если коротко: он там много говорит о том, что мы живем в мире победившего парадокса Моравека, что мне показалось довольно новой перспективой. Современные модели отлично работают в кодинге, текстах, абстрактной логике, и так далее. Но они могут быть совершенно беспомощны в вещах, которые любой трехлетний ребенок делает не задумываясь.
Причиной он называет то, что “…высококогнитивные процессы требуют относительно небольших вычислений, в то время как низкоуровневые сенсомоторные операции требуют огромных вычислительных ресурсов”. Что можно примерно перевести как “работать с текстами на самом деле очень просто, по сравнению с вижуал (и всякими другими) инпутами”. Идея интересная, но скорее довольно far-fetched и философская, но в целом указывает в верном направлении.
Применяя эту логику к VLM-моделям, можем сделать предположение, что у них во многом отсутствует spatial cognition (от себя бы еще добавил temporal cognition). Весь этот хайп вокруг frontier моделей построен на топ-даун подходе, когда мы скормили моделям терабайты (тексты + картинки) данных в надежде, что из этого вырастет понимание физики, но пока что не получается. На разных базовых тестах, вроде 3D object mental rotation, прохождения лабиринтов или поиска коротких путей, VLM показывают результаты на уровне случайного угадывания (статья с бенчмарком).
Один из интересных пойнтов был такой, что топорный скейлинг здесь больше не поможет. Чтобы помочь модели лучше понимать физику, её нужно дообучать (и тут я плюсую) и менять саму архитектуру инференса (тут ничего сказать не могу). Из интересного: сейчас моделям пытаются прикрутить visual chain of thought, когда модель перед ответом генерирует промежуточные визуальные токены, прежде чем выдать файнал предикшен (статья с примером).
Возвращаясь к моему опыту со всеми этими моделями, я почти со всем согласен. Out of the box VLM-модели действительно не понимают физику движений, динамику объектов и пространственный контекст в видео-инпутах. Но я бы не согласился с тем, что проблема именно в каком-то концептуально плохом архитектурном решении, а скорее в качестве и количестве физических данных, на которых эти модели обучались. Перед тем как делать громкие заявления на уровне “LLMs/VLMs are dead”, я бы попробовал нормально собрать данные для своей конкретной задачи и качественно сделать пост-трейнинг, это вполне себе неплохо работает.
PS: А теперь интерактив, к посту я заатачил видос из интернетов с примером смены полосы (файл в комментах). Чтобы более наглядно прочувствовать то, о чем я писал выше, предлагаю подписчикам засунуть этот видос в LLM of choice с вопросом “Does this video contain a lane-change maneuver?” (с выключенным Thinking mode). Результаты пишите в комментарии. Мое предположение, что в 90% случаев ответ будет “No”.
Post #137
854
- 🔥 4
- ❤ 3