TGViewer
Никита и его пост-пшд Никита и его пост-пшд @phdnikita · 973 subscribers
Post #137 854
Вдогонку к прошлому посту про зачаточный уровень physical reasoning у VLM-ок и то, почему AGI еще не здесь.

Недавно я пропустил, как Vladlen Koltun (там еще были Yann LeCun и Jitendra Malik) рассказывал про «On Spatial Cognition in Frontier Models» в ETH, и очень обидно, что я все пропустил (энивей, ссылка тут, советую посмотреть). Его поинты — это на самом деле хорошая иллюстрация того, где вообще находится лимит у VLM в физических задачах, что я упоминал ранее.

Если коротко: он там много говорит о том, что мы живем в мире победившего парадокса Моравека, что мне показалось довольно новой перспективой. Современные модели отлично работают в кодинге, текстах, абстрактной логике, и так далее. Но они могут быть совершенно беспомощны в вещах, которые любой трехлетний ребенок делает не задумываясь.

Причиной он называет то, что “…высококогнитивные процессы требуют относительно небольших вычислений, в то время как низкоуровневые сенсомоторные операции требуют огромных вычислительных ресурсов”. Что можно примерно перевести как “работать с текстами на самом деле очень просто, по сравнению с вижуал (и всякими другими) инпутами”. Идея интересная, но скорее довольно far-fetched и философская, но в целом указывает в верном направлении.

Применяя эту логику к VLM-моделям, можем сделать предположение, что у них во многом отсутствует spatial cognition (от себя бы еще добавил temporal cognition). Весь этот хайп вокруг frontier моделей построен на топ-даун подходе, когда мы скормили моделям терабайты (тексты + картинки) данных в надежде, что из этого вырастет понимание физики, но пока что не получается. На разных базовых тестах, вроде 3D object mental rotation, прохождения лабиринтов или поиска коротких путей, VLM показывают результаты на уровне случайного угадывания (статья с бенчмарком).

Один из интересных пойнтов был такой, что топорный скейлинг здесь больше не поможет. Чтобы помочь модели лучше понимать физику, её нужно дообучать (и тут я плюсую) и менять саму архитектуру инференса (тут ничего сказать не могу). Из интересного: сейчас моделям пытаются прикрутить visual chain of thought, когда модель перед ответом генерирует промежуточные визуальные токены, прежде чем выдать файнал предикшен (статья с примером).

Возвращаясь к моему опыту со всеми этими моделями, я почти со всем согласен. Out of the box VLM-модели действительно не понимают физику движений, динамику объектов и пространственный контекст в видео-инпутах. Но я бы не согласился с тем, что проблема именно в каком-то концептуально плохом архитектурном решении, а скорее в качестве и количестве физических данных, на которых эти модели обучались. Перед тем как делать громкие заявления на уровне “LLMs/VLMs are dead”, я бы попробовал нормально собрать данные для своей конкретной задачи и качественно сделать пост-трейнинг, это вполне себе неплохо работает.

PS: А теперь интерактив, к посту я заатачил видос из интернетов с примером смены полосы (файл в комментах). Чтобы более наглядно прочувствовать то, о чем я писал выше, предлагаю подписчикам засунуть этот видос в LLM of choice с вопросом “Does this video contain a lane-change maneuver?” (с выключенным Thinking mode). Результаты пишите в комментарии. Мое предположение, что в 90% случаев ответ будет “No”.
  • 🔥 4
  • ❤ 3
More from @phdnikita
  1. Jun 1, 2026Хотя уже прошёл целый год, у меня ещё осталось несколько проектов с епфл, которые публикую…
  2. May 29, 2026Дорогие подписчики, этот канал НЕ мертв, но наличие работы в моей жизни явно отвлекает мен…
  3. May 29, 2026Channel name was changed to «Никита и его пост-пшд»
  4. May 29, 2026Channel photo updated
  5. Jun 26, 2025Ну и раз я вчера упомянул, что пока еще разбираюсь с последними проектами в универе, то во…
  6. Jun 25, 2025Так-с, активности на работе оказались слишком активными, поэтому я немного выпал. Но! В на…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →