От восприятия к визуальному мышлению:
как добавить ИИ внутреннее «воображение»
Мультимодальные модели умеют распознать объект на фото, прочитать подпись, ответить на вопрос по картинке. Но стоит попросить их сделать то, что человек делает почти на автомате, мысленно повернуть фигуру, продолжить узор, пройтись по схеме шаг за шагом, и уверенность у ИИ-моделей падает. Как будто ИИ видит, но не может удержать картинку «в голове» и нормально с ней поработать.
Самое интересное, что проблема не всегда в «умности» модели, а в интерфейсе мышления. Мы привыкли лечить ошибки длинными текстовыми рассуждениями, но текст плохо подходит для пространственных операций. А что если часть мышления вообще не переводить в слова?
В полном обзоре разберём работу CogSense: зачем исследователи собрали бенчмарк, который проверяет именно визуальное мышление, и как они добавили модели внутреннее латентное воображение, чтобы она не просто описывала картинку, а действительно могла мысленно симулировать и планировать действия.
📜 Полный обзор
Post #140
122