8位AI创业者激辩世界模型:从生成到理解,还差什么?
世界机器人大会上,8位AI创业者与王坚对话,探讨世界模型的定义、技术路线与落地挑战。共识是:世界模型不能止于生成,需理解物理世界底层逻辑;数据稀缺但理解力提升可降低依赖;落地路径从工业到商业再到家庭。
2026年世界机器人大会闭幕日,一场聚焦“世界模型到服务人类的现实距离”的论坛对话,把八位来自模型、数据、本体、仿真等不同赛道的创业者拉到了同一张圆桌前。这场由之江实验室主任、阿里云创始人王坚主持的讨论,试图回答一个看似基础却极具争议的问题:世界模型,到底是什么?
从生成到理解:世界模型的“皇冠明珠”之争
对话伊始,王坚便抛出了核心议题——世界模型与现有模型有何不同。商汤科技联合创始人王晓刚回顾了自家“开悟”世界模型的发展路径,指出其应用经历了三个阶段:从最初的数据增强(举一反三),到作为模拟仿真器驱动端到端自动驾驶,再到如今的World Action Model——直接部署到机器人终端的大脑。他强调,世界模型与传统的VLA(视觉-语言-动作)模型有本质区别:VLA仍属于模仿学习,针对特定任务和硬件,难以涌现智能;而世界模型假设世界在交互中不断演化,模型需具备理解、生成、预测一体化的能力,实时演绎未来状态并控制本体。
奥比中光创始人黄源浩则用“卖铲子的”自嘲,其公司专攻世界模型的视觉数据,将多模态数据做到毫秒级同步。他大胆预测,具身智能的市场可能比数字智能大5到10倍,而“具身智能的GPT时刻”可能很快到来。王坚随即幽默地建议将其改为“具身智能的DeepSeek时刻”,引发全场会心一笑。
无界动力创始人张玉峰从智能驾驶领域切入,指出世界模型概念早已有之,其CTO在2011年博士期间研究的model-based reinforcement learning就是雏形。他批评VLA的模仿学习范式追求概率分布和“肌肉记忆”,却缺乏对物理世界底层逻辑的理解,难以实现零样本或少样本的泛化涌现。无界动力因此选择隐空间世界模型路线,让计算在高维表征中进行,而非像素层面,以更高效地推理时空因果。
跨维智能创始人贾奎将世界模型比作“生成式AI皇冠上的明珠”,认为它是语言、图像、视频、3D生成之后的最高潮——目标是生成符合三维物理几何绝对正确的可交互动态环境。智澄AI创始人胡鲁辉则押注JEPA技术路线,相信世界模型将如AlexNet、Transformer一样带来颠覆性影响。飞渡科技联合创始人宋彬总结了世界模型的几大流派,并把底座能力比作“九年义务教育”——先建立物理常识和泛化能力,再进入垂直领域的“职业训练”。
落地之难:数据、算力与安全的三重挑战
讨论随即转向更现实的问题:世界模型要服务人类,还差哪几步?蚂蚁灵波科技首席科学家沈宇军泼了一盆冷水:视频模态和动态建模固然重要,但模型发展是否真的对机器人操作有实际帮助才是关键,否则就是空中楼阁。
极佳视界联合创始人朱政的分享则颇具戏剧性。他透露,2023年公司成立时,投资人因听不懂“世界模型”而拒绝投资;而到去年,估值在12个月内涨了50倍。这一反差折射出行业热度的急剧升温。
对话的最后一个议题聚焦高质量数据是否会成为不可逾越的成本障碍。与会者普遍认为,数据稀缺是现实瓶颈,但模型一旦具备真正的理解力,数据依赖可能会急剧下降——这是突破模仿学习范式的关键回报。然而,更棘手的约束来自工程层面:边缘算力有限,功耗不能无限膨胀,安全机制和熔断设计必须同步跟上。
八位创业者从不同赛道出发,最终指向同一个问题:从生成到理解,中间还差什么?他们的共识是,世界模型不能停留在“生成得像”,而必须跨过模仿学习,理解物理世界的底层逻辑;落地的路径也并非一步跨进家庭,而是先到工业里练技能,再到商业场景里练泛化,最后才敢叩响家门。这场关于“皇冠明珠”的漫长赌局,终局或许在于从垂类到通用的跨越。