在今年的 WAIC 2026 世界人工智能大会暨人工智能全球治理高级别会议主论坛上,自动驾驶和具身智能的热词 “世界模型”,被单独拿出做了一场名为“从虚拟到现实:世界模型如何驱动具身智能”的圆桌讨论。
这个圆桌由复旦大学副校长姜育刚主持,对话嘉宾来自于物理AI产业界的智元机器人姚卯青、它石智航创始人兼 CEO 陈亦伦,以及亮源新创创始人姚颂。
这场圆桌讨论的反共识之处在于:大家并没有把世界模型简单理解成数字世界“更会生成视频的模型”,而是把它放回Physical AI 的具身智能和自动驾驶行业中讨论。
同时他们所在的企业都在实践和探索物理AI的应用和落地,所以值得我们来探讨和学习,本文就他们圆桌讨论世界模型的观点和经验进行总结分享,希望给大家带来一些信息和启发。
姚卯青:世界模型不是生成画面,而是预测状态作为圆桌讨论中的第一个回答来自智元机器人姚卯青。他给世界模型下的定义很直接:在 Physical AI 相关领域里,世界模型的本质是一个能够理解物理世界运行规律的 AI 系统。它最重要的功能,是预测世界的下一个状态,而不是简单选择下一帧画面或生成一段看起来合理的视频。
在他看来,一个真正的世界模型至少要具备几种能力:
理解多模态信息,把现实世界中不同维度的输入融合起来;
掌握物理规律,包括动力学和空间关系;
具备因果推理能力,知道“物体为什么被推动、为什么倒下”;
要能做长时间、长程推理,并且在连续推演中不崩坏。
这其实都是行业内在世界模型探索中的难点。
也是在给世界模型划边界:视频生成只是表面能力,物理状态预测才是底层能力。姚卯青的一个关键判断可以概括为一句话:世界模型不是预测下一张画面,而是预测世界的下一个状态。
谈到落地,他认为未来三年内,具身智能更可能先在“高频刚需、环境可控、确定性强”的场景里落地。智元已经在产线场景做过连续多日直播验证,现场姚卯青提到“六天、每天十几个小时、六万多件产线操作、整体成功率 99.99%”。他的判断很务实:家庭等开放环境还需要更强的通用泛化能力,而工业产线这种确定性任务,会更早成为具身智能的试验田。
陈亦伦:世界模型要回答“动作之后世界会怎样”
它石智航陈亦伦把世界模型讲得更偏机器人控制。他认为,VLA 可以告诉机器人“下一步该做什么动作”,但世界模型还要进一步回答:“如果做了这个动作,世界状态会发生什么变化?这个变化是不是我们想要的?”
当然VLA也在训练推理,这个可以看我们之前分享英伟达《英伟达 Alpamayo:基于推理的自动驾驶大模型设计与量产部署全解析》alpamayo的文章。
不过,他把世界模型的问题拆成 State、Action、Reward:状态、动作和反馈。世界模型不是孤立地预测状态,也不是孤立地输出动作,而是预测 Action 和 State 之间的联合关系。这样一来,它就可以把监督学习和强化学习结合起来,让机器人任务的完成度、可靠性和成功率更高。
这段发言里最有力量的一句话是:神经网络不应该只是给一个 Action,它应该给出 Action 背后的东西。
陈亦伦还指出,当前最大的瓶颈是数据。公开视频主要提供几何和视觉信息,对非接触系统或许有帮助,但机器人操作是接触系统。单纯看视频,很难获得力、触觉、柔性、摩擦等关键物理量。也就是说,视频能告诉模型“看起来发生了什么”,却未必能告诉模型“物理上为什么会这样发生”。
因此,他认为训练真正可用的世界物理模型,需要三类条件:
模态齐全,不只有视频,还要有力和触觉;
数据要来自高频交互,机器人要不断通过动作改变状态;
数据必须来自真实场景、真实任务。
他给出的量级判断也很鲜明:如果自动驾驶做到工业级可用需要约百万小时级数据,那么更复杂的具身操作可能需要千万小时级数据。
姜旭:仅靠世界模型不够,具身智能还需要三次范式突破
姜旭的观点更像是从大模型产业史中看世界模型。他认为,世界模型的核心任务可以拆成两部分:预测下一个状态,或者对视频模型来说预测下一帧;以及预测下一个动作。如果必须取舍,他更看重“预测下一个动作”,因为训练世界模型的最终目的,是控制机器人。
他的判断来自一个类比:过去几年大模型的发展,本质上是通过大规模模仿人,最终在某些能力上超越人。具身智能也可能走类似路径。但人在物理世界行动时,并不会时时刻刻显式预测下一状态;人更多是基于充分观察,直觉地做出动作。因此他提出一个非常清楚的分工:状态应该被感知,动作应该被预测。
姜旭也提醒,世界模型突然变热,但“仅靠世界模型无法实现具身智能”。他把大模型爆发归纳为三次范式突破:可规模化预训练、可规模化对齐、可规模化商业化与部署。语言模型如此,代码模型如此,视频模型如此,具身智能也不会例外。
在商业落地上,他延续了大模型产品史的思路:AI 能力早期往往不擅长精确性和可靠性,因此会先在高容错率场景爆发。ChatGPT 早期有幻觉,但作为助手可以被容忍;代码模型早期只是补全建议,由程序员选择;视频模型早期可以通过“抽卡”使用。具身智能也需要寻找类似的高容错率场景,而不是一开始就进入零失误、强责任的任务。
共识:世界模型的关键不是“生成”,而是“行动前的理解”
从三位嘉宾的观点看,WAIC 上关于世界模型至少形成了几个共识。
世界模型必须面向物理规律。只会生成图像或视频的模型,不等于具身智能需要的世界模型。它必须理解动力学、空间关系、因果关系和长程演化。
世界模型必须和动作绑定。真正有价值的不是“世界会变成什么样”,而是“我做出某个动作后,世界会怎样变化”。这也是它区别于普通视频生成模型的关键。
世界模型的最大瓶颈是数据,尤其是真实物理交互数据。公开视频数据有价值,但远远不够。机器人需要的是状态、动作、力、触觉、结果反馈共同构成的数据闭环。
世界模型只是具身智能的一环。要让机器人真正走向产业,还需要本体、数据、模型、场景、商业化部署一起形成飞轮。
这个其实和我们之前文章《世界模型 101:概念、技术争鸣与科学应用》是一致。所以,能看到世界模型在产业界正在快速的探索应用和迭代,是当前Physical AI重要的算法核心。
最后总结:世界模型正在从“想象世界”走向“介入世界”
如果说过去数字世界的世界模型讨论,更多停留在“模型能不能生成一个逼真的世界”,那么 WAIC 这场圆桌把问题推进了现实物理世界中:世界模型能不能让 AI 在真实世界中行动?
姚卯青强调状态预测和物理规律,陈亦伦强调 Action-State 的联合建模和接触数据,姜旭强调动作预测、规模化训练以及商业落地场景。三个人的表达方式不同,但指向同一个判断:世界模型的终点不是生成世界,而是帮助机器人理解世界、预测世界,并在世界中完成任务。
这也是这场讨论透露出产业界的风向。世界模型正在从虚拟世界里的“想象力”,变成物理世界里的“行动力”。它不再只是 AI 看世界的一双眼睛,而是 AI 进入世界之前,先在脑中推演的一套内在物理剧场。谁能把这个剧场和真实数据、真实机器人、真实场景打通,谁就更接近具身智能真正的 ChatGPT 时刻,随着这次WAIC上“世界模型”这个词所占分量的凸出,不可否认具身智能真正的 ChatGPT 时刻不会太远就会到来。
*未经准许严禁转载和摘录-
原文标题 : WAIC 2026 圆桌讨论 - 从虚拟到现实:世界模型如何驱动具身智能
在今年的 WAIC 2026 世界人工智能大会暨人工智能全球治理高级别会议主论坛上,自动驾驶和具身智能的热词 “世界模型”,被单独拿出做了一场名为“从虚拟到现实:世界模型如何驱动具身智能”的圆桌讨论。
这个圆桌由复旦大学副校长姜育刚主持,对话嘉宾来自于物理AI产业界的智元机器人姚卯青、它石智航创始人兼 CEO 陈亦伦,以及亮源新创创始人姚颂。
这场圆桌讨论的反共识之处在于:大家并没有把世界模型简单理解成数字世界“更会生成视频的模型”,而是把它放回Physical AI 的具身智能和自动驾驶行业中讨论。
同时他们所在的企业都在实践和探索物理AI的应用和落地,所以值得我们来探讨和学习,本文就他们圆桌讨论世界模型的观点和经验进行总结分享,希望给大家带来一些信息和启发。
姚卯青:世界模型不是生成画面,而是预测状态作为圆桌讨论中的第一个回答来自智元机器人姚卯青。他给世界模型下的定义很直接:在 Physical AI 相关领域里,世界模型的本质是一个能够理解物理世界运行规律的 AI 系统。它最重要的功能,是预测世界的下一个状态,而不是简单选择下一帧画面或生成一段看起来合理的视频。
在他看来,一个真正的世界模型至少要具备几种能力:
理解多模态信息,把现实世界中不同维度的输入融合起来;
掌握物理规律,包括动力学和空间关系;
具备因果推理能力,知道“物体为什么被推动、为什么倒下”;
要能做长时间、长程推理,并且在连续推演中不崩坏。
这其实都是行业内在世界模型探索中的难点。
也是在给世界模型划边界:视频生成只是表面能力,物理状态预测才是底层能力。姚卯青的一个关键判断可以概括为一句话:世界模型不是预测下一张画面,而是预测世界的下一个状态。
谈到落地,他认为未来三年内,具身智能更可能先在“高频刚需、环境可控、确定性强”的场景里落地。智元已经在产线场景做过连续多日直播验证,现场姚卯青提到“六天、每天十几个小时、六万多件产线操作、整体成功率 99.99%”。他的判断很务实:家庭等开放环境还需要更强的通用泛化能力,而工业产线这种确定性任务,会更早成为具身智能的试验田。
陈亦伦:世界模型要回答“动作之后世界会怎样”
它石智航陈亦伦把世界模型讲得更偏机器人控制。他认为,VLA 可以告诉机器人“下一步该做什么动作”,但世界模型还要进一步回答:“如果做了这个动作,世界状态会发生什么变化?这个变化是不是我们想要的?”
当然VLA也在训练推理,这个可以看我们之前分享英伟达《英伟达 Alpamayo:基于推理的自动驾驶大模型设计与量产部署全解析》alpamayo的文章。
不过,他把世界模型的问题拆成 State、Action、Reward:状态、动作和反馈。世界模型不是孤立地预测状态,也不是孤立地输出动作,而是预测 Action 和 State 之间的联合关系。这样一来,它就可以把监督学习和强化学习结合起来,让机器人任务的完成度、可靠性和成功率更高。
这段发言里最有力量的一句话是:神经网络不应该只是给一个 Action,它应该给出 Action 背后的东西。
陈亦伦还指出,当前最大的瓶颈是数据。公开视频主要提供几何和视觉信息,对非接触系统或许有帮助,但机器人操作是接触系统。单纯看视频,很难获得力、触觉、柔性、摩擦等关键物理量。也就是说,视频能告诉模型“看起来发生了什么”,却未必能告诉模型“物理上为什么会这样发生”。
因此,他认为训练真正可用的世界物理模型,需要三类条件:
模态齐全,不只有视频,还要有力和触觉;
数据要来自高频交互,机器人要不断通过动作改变状态;
数据必须来自真实场景、真实任务。
他给出的量级判断也很鲜明:如果自动驾驶做到工业级可用需要约百万小时级数据,那么更复杂的具身操作可能需要千万小时级数据。
姜旭:仅靠世界模型不够,具身智能还需要三次范式突破
姜旭的观点更像是从大模型产业史中看世界模型。他认为,世界模型的核心任务可以拆成两部分:预测下一个状态,或者对视频模型来说预测下一帧;以及预测下一个动作。如果必须取舍,他更看重“预测下一个动作”,因为训练世界模型的最终目的,是控制机器人。
他的判断来自一个类比:过去几年大模型的发展,本质上是通过大规模模仿人,最终在某些能力上超越人。具身智能也可能走类似路径。但人在物理世界行动时,并不会时时刻刻显式预测下一状态;人更多是基于充分观察,直觉地做出动作。因此他提出一个非常清楚的分工:状态应该被感知,动作应该被预测。
姜旭也提醒,世界模型突然变热,但“仅靠世界模型无法实现具身智能”。他把大模型爆发归纳为三次范式突破:可规模化预训练、可规模化对齐、可规模化商业化与部署。语言模型如此,代码模型如此,视频模型如此,具身智能也不会例外。
在商业落地上,他延续了大模型产品史的思路:AI 能力早期往往不擅长精确性和可靠性,因此会先在高容错率场景爆发。ChatGPT 早期有幻觉,但作为助手可以被容忍;代码模型早期只是补全建议,由程序员选择;视频模型早期可以通过“抽卡”使用。具身智能也需要寻找类似的高容错率场景,而不是一开始就进入零失误、强责任的任务。
共识:世界模型的关键不是“生成”,而是“行动前的理解”
从三位嘉宾的观点看,WAIC 上关于世界模型至少形成了几个共识。
世界模型必须面向物理规律。只会生成图像或视频的模型,不等于具身智能需要的世界模型。它必须理解动力学、空间关系、因果关系和长程演化。
世界模型必须和动作绑定。真正有价值的不是“世界会变成什么样”,而是“我做出某个动作后,世界会怎样变化”。这也是它区别于普通视频生成模型的关键。
世界模型的最大瓶颈是数据,尤其是真实物理交互数据。公开视频数据有价值,但远远不够。机器人需要的是状态、动作、力、触觉、结果反馈共同构成的数据闭环。
世界模型只是具身智能的一环。要让机器人真正走向产业,还需要本体、数据、模型、场景、商业化部署一起形成飞轮。
这个其实和我们之前文章《世界模型 101:概念、技术争鸣与科学应用》是一致。所以,能看到世界模型在产业界正在快速的探索应用和迭代,是当前Physical AI重要的算法核心。
最后总结:世界模型正在从“想象世界”走向“介入世界”
如果说过去数字世界的世界模型讨论,更多停留在“模型能不能生成一个逼真的世界”,那么 WAIC 这场圆桌把问题推进了现实物理世界中:世界模型能不能让 AI 在真实世界中行动?
姚卯青强调状态预测和物理规律,陈亦伦强调 Action-State 的联合建模和接触数据,姜旭强调动作预测、规模化训练以及商业落地场景。三个人的表达方式不同,但指向同一个判断:世界模型的终点不是生成世界,而是帮助机器人理解世界、预测世界,并在世界中完成任务。
这也是这场讨论透露出产业界的风向。世界模型正在从虚拟世界里的“想象力”,变成物理世界里的“行动力”。它不再只是 AI 看世界的一双眼睛,而是 AI 进入世界之前,先在脑中推演的一套内在物理剧场。谁能把这个剧场和真实数据、真实机器人、真实场景打通,谁就更接近具身智能真正的 ChatGPT 时刻,随着这次WAIC上“世界模型”这个词所占分量的凸出,不可否认具身智能真正的 ChatGPT 时刻不会太远就会到来。
*未经准许严禁转载和摘录-
原文标题 : WAIC 2026 圆桌讨论 - 从虚拟到现实:世界模型如何驱动具身智能