GPT-6 在多模态模型容易出现 “Look Light, Think Heavy” 的问题上越来越明显了,用解释代替观看也是人类常犯的错误
看图越来越浅,语言推理越来越长,都是基于语言的自迭代和解释而脱离视觉本身,这在对 image 2.5 的使用里明显干扰和脱节
这个问题的提出来自论文:Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
Post #4935
140
