
【多模态AI论坛引关注】
7月18日上午,WAIC 2026最受关注的“基座大模型架构创新与生态合作论坛”,由商汤科技承办,吸引了无数AI研究者、产业专家和投资机构目光,因其直面大模型行业核心焦虑:当Scaling Law逼近物理极限,多模态是破局“解药”,还是新瓶装旧酒的延伸?
【首席科学家圆桌交锋】
由商汤科技首席科学家林达华主持的“首席科学家”圆桌对话,有复旦大学邱锡鹏教授,达摩院首席科学家赵德丽、阶跃星辰首席科学家张祥雨、新加坡南洋理工大学刘子纬教授共同参与,堪称多模态AI迈入“深水区”后,中国AI行业的首次集体审视与深度交锋。
【多模态核心问题探讨】
过去一个多月,GPT - 5.6等国际最新模型亮相。林达华指出,如今先进大模型多把多模态理解能力成“标配”。但问题来了,多模态是大语言模型能力边界延伸,还是下一代智能起点?依靠Next Token Prediction建立的大模型,能理解物理世界吗?五位科学家围绕多模态内生本质、核心瓶颈及5年后终极图景展开辩论。
【“走出洞穴”:多模态是“外挂”还是“灵魂”?】
林达华开场抛出核心问题,业内有两种声音。一种认为大语言模型是未来AI核心,多模态是其能力边界自然延伸;另一种认为AI走向物理空间时,多模态是智能原生组成部分,非语言模型外挂。未来AI应以语言还是世界为中心?邱锡鹏认为智能依赖语言,多模态发展重点是与语言对齐,当前大模型距理解世界远,缺Context,未来多模态发展或需围绕现实环境构建Harness。赵德丽则认为基于多模态的模型是下一代智能范式,他总结通向智能四条路径,都与多模态有关,还举例猎豹捕猎等说明非语言学习智能。他指出物理世界需四维因果关系建模,大语言模型是一维的。张祥雨关注“学习范式”,认为核心是让智能体学会自主学习。语言模型因训练数据静态、信息密度高在“模仿学习”范式占优,视觉信号则不然。但大模型走向智能体时代,智能体缺自我进化能力。刘子纬从哲学层面判断,引用柏拉图洞穴比喻,把语言比作化石燃料,认为多模态数据是未来方向,高价值任务离不开多模态。可见,多模态正从“辅助工具”走向“核心基础设施”,驱动力是AI应用场景向物理空间迁移。
【数据、架构、范式:多模态跃迁缺什么?】
林达华把问题拉回现实:当前主流AI方法,如数据、模型结构、训练范式,能支撑到下一阶段吗?瓶颈在哪?业内观点分野。乐观者认为当前模型架构有潜力,缺高质量多模态数据;审慎者认为问题不止数据量,基于Next Token预测的训练方法不擅学习物理规律等,需新范式。刘子纬判断数据、模型结构、训练范式都需改进。数据层面,语言模型积累条件好,多模态数据记录保存需更好范式;架构层面,整体架构以语言模型为核心,“原生多模态”挑战待解;学习范式是更大问题。张祥雨深挖“持续进化”,认为自主学习路径有分歧,多模态让上下文问题更严重。他抛出问题:仅靠外部记忆,智能体能演化吗?他指出下一代自主学习要解决三大问题,当下在线学习最值得投入。在线学习面临层次化记忆建模和学习算法本身两个核心挑战。林达华追问Memory机制,张祥雨认同这是前沿研究点。赵德丽加入讨论,认为模型架构收敛、大家做应用是误区。AI走向物理世界先面对数据问题,中国在具身方向有优势。他强调训练范式和算法架构重要,Memory创新涉及软硬件协同和数据使用,还举例DeepSeek的Ingram算法。至此,关于“瓶颈是什么”讨论递进,科学家视角交错补充。
【高估Agent,低估社会变迁:五年预言】
林达华问未来5年,什么会被高估、低估?他认为AI取代人类工作被高估,范式变革速度被低估。邱锡鹏称预测难,下一代范式变革可能是“AI for AI”,强调渐进式演化力量。赵德丽预测“Agent自主化能力”被高估,“AI对社会运作方式改变”被低估,还举例支付体系重构。两种预测方向互补。
【结语:多模态成AI产业新战场】
在通往物理世界智能道路上,语言模型重要但不够。顶尖学者从不同维度指向多模态是下一代智能原生基础。当前多模态AI处关键转折点,算法架构创新未停,产业落地中国有优势。多模态正成AI产业新主战场,“灵魂”与“外挂”论战决定物理AI下半场走向。

1873

被折叠的 条评论
为什么被折叠?



