【硅谷101】“谷歌太慢了”:与Andrew Dai聊Gemini的翻身之战,出走与视觉理解模型
本期对话了在谷歌深耕14年的前核心AI科学家Andrew Dai。作为大模型预训练、MoE架构及Gemini研发的关键人物,他复盘了谷歌错失先机背后的故事,以及Brain与DeepMind合并初期的内部摩擦与大厂难以避免的效率损耗。
访谈披露了众多硬核技术发展细节。Andrew早在2015年就验证了预训练加微调的潜力,2021年便涉足MoE架构,但均因大公司求稳未能抢占首发。他指出,在算力与架构趋同的今天,大模型最大的壁垒在于数据。精准清洗劣质内容把控合成数据质量,才是决定模型上限的核心秘方。
离开谷歌后,他创立了主攻多模态视觉推理的新实验室。他认为纯语言大模型无法触达AGI,而纯视觉模型又缺乏人类逻辑常识。只有将语言思维与视觉理解结合,让AI能够处理物理世界中如系鞋带、拼家具等复杂的视觉交互难题,才是真正通往视觉AGI的破局路径。
(这一段总结是由 Gemini 生成的)
#大语言模型 #谷歌AI #Gemini #视觉推理 #AGI source
Post #5000
1.4K
