现在很多企业探索让自动驾驶和具身智能使用相似的基础模型。
小鹏已经将VLA 2.0、Robotaxi和人形机器人纳入Physical AI布局,并提出以物理世界基础模型支撑不同智能载体。
学术界也有研究让同一个模型跨越车辆、轮式机器人、无人机等不同载体完成导航任务。
汽车和机器人面对的环境、传感器、运动方式都不同,为什么还要尝试共用一套基础模型?
01 为什么汽车和机器人开始需要相似的基础模型?
过去,自动驾驶和机器人基本沿着各自的技术路线发展。
自动驾驶面对的是道路、车辆、行人、交通信号和复杂交通关系,需要持续完成环境感知、场景理解、行为预测、路径规划和车辆控制。
机器人面对的环境则更加多样,除了移动,还涉及目标识别、抓取、搬运、操作等任务。两者看起来差别很大,但从更底层的角度看,它们解决的都是一个相似问题,即如何让机器理解真实世界,并根据理解结果采取行动。

图片源自:网络
视觉语言动作模型(Vision-Language-Action,VLA)的出现,正好把这个问题进一步向前推进。
VLA不只是识别图像中的物体,而是尝试把视觉信息、任务目标和动作联系起来,让模型从看到了什么进一步走向接下来应该做什么。
对于汽车来说,模型需要理解道路环境、周围交通参与者以及当前驾驶任务,并据此形成驾驶行为;对于机器人来说,模型同样需要理解周围空间、任务要求和目标物体,再决定移动、抓取或者操作。
因此,真正值得被共享的并不是一整套完整的汽车模型或者机器人模型,而是视觉理解、空间关系理解、任务推理,以及对环境变化进行预测的能力等更基础的能力。
这种跨载体共享已经开始出现在一些具体的研究中。如ICLR 2026收录的Embodied Navigation Foundation Model(NavFoM)尝试使用统一架构处理四足机器人、无人机、轮式机器人和车辆等不同载体的导航任务,其中就包括自动驾驶场景。
02 能理解同一个世界不代表能执行同一个动作
汽车和机器人虽然都需要感知、理解、行动,但它们的动作空间完全不同。汽车的运动受到车辆尺寸、转向特性、动力学、道路结构以及交通规则等多重约束。
对于采用端到端或VLA架构的系统,模型可以直接生成未来一段时间的车辆轨迹,也可以先形成驾驶意图,再由后续模块完成轨迹生成和控制。
机器人则不同。
人形机器人可以控制身体、手臂和手部关节,机械臂需要处理末端执行器的空间位置,轮式机器人主要解决移动和导航问题。即使面对同一个物体,不同机器人的动作方式也可能完全不同。
所以,对于统一模型的研究,不能简单理解为一个模型能不能同时处理汽车和机器人,而是需要研究模型究竟能够统一到哪一层。
如前方存在障碍物、目标位于左侧、当前路径受到阻挡等语义信息,在不同物理载体之间具有较强的共通性。
对汽车而言,它可能意味着减速、停车、变道或者绕行,并需要生成符合车辆运动约束的轨迹;对轮式机器人而言,可能意味着重新规划移动路径;对带机械臂的机器人而言,还可能意味着改变操作方式或者直接移动障碍物。

图片源自:网络
因此,大模型统一的是靠近世界理解和任务推理的部分,而越靠近具体载体的动作生成与控制层,就越需要根据自身的身体结构、动力学和动作空间进行适配。
在机器人领域,这种思路已经有了实际落地。例如X-VLA通过Soft Prompt引入不同机器人硬件、传感器配置和数据域的信息,让同一个基础模型能够适应不同机器人,而不是要求所有机器人拥有完全相同的动作空间。
这也说明了一个重要问题,基础模型可以尽量统一,但不同的身体不能被忽略。
03 真正难的是让模型理解自己能做什么
汽车和机器人共享基础模型最困难的地方不是环境理解,而是具身差异。模型不仅要知道外部世界是什么样,还要知道自己的状态、运动能力和动作会受到什么限制。
如同样看到前方存在障碍物,汽车和机器人对这个信息的处理方式并不相同。
汽车行驶在道路上,需要结合道路边界、交通参与者、车辆自身尺寸、速度以及车辆动力学,判断减速、停车或者绕行是否可行。
它不能简单地把避开障碍物理解成向旁边移动,因为旁边可能存在其他车辆,也可能根本没有可行驶空间。某些机器人则可能拥有更加丰富的行动选择。
它可以停下来、转身、改变路径,部分具备操作能力的机器人甚至可以利用机械臂处理障碍物。但这些能力同样取决于机器人的具体结构、关节配置、负载能力和任务要求。

图片源自:网络
这也意味着,所谓物理智能不能只理解成对外部世界的理解。
它还需要回答我现在处于什么状态?我具备哪些能力?哪些动作是可执行的?执行这个动作之后,环境可能发生什么变化?
等多个问题。同样一句向前走,对于汽车、轮式机器人和人形机器人来说,并不是完全相同的动作。它们的身体结构不同,运动能力不同,传感器配置不同,与环境的交互方式也不同。
因此,如果未来真的出现一套同时服务自动驾驶和具身智能的基础模型,它需要处理的不只是一个统一的世界表示,还需要把不同物理载体的状态、能力和动作空间纳入模型体系。
这也是为什么当前Physical AI的研究和产业探索,会同时关注基础模型、VLA和世界模型。
模型需要逐渐从理解当前环境走向理解行动与环境变化之间的关系。
04 一套基础模型最终会通吃吗?
如果把通吃理解成一套完全相同的模型,不做任何适配,就直接控制汽车、机器人甚至其他智能设备,这条路线短期内并不现实。
但如果把通吃理解成不同物理智能体共享一个基础模型的部分核心能力,那么这条路线已经出现了比较明确的研究和产业探索。汽车仍然需要自己的车辆轨迹生成和控制能力,机器人也仍然需要适配自身的移动、操作和执行能力。
基础模型负责的可能是更上层的理解和推理,而不同的身体负责把这些能力转化为符合自身约束的具体动作。
换句话说,未来真正可能被统一的,不一定是怎么开车和怎么走路,而是它们背后更底层的智能能力。
这也是为什么越来越多自动驾驶企业进入具身智能领域的原因。
自动驾驶长期积累的感知、空间理解、预测、规划和实时决策能力,本身就是面向物理世界的一套技术积累;机器人面对的同样是真实环境中的感知、推理与行动问题。
一套基础模型通吃不是一个模型控制所有机器,而是汽车、机器人等不同物理智能体开始共享一个用于理解世界和进行推理的基础模型底座,同时保留各自与身体结构、动作空间和控制能力相关的适配层。
#自动驾驶 #具身智能 #大模型
原文标题 : 从自动驾驶到具身智能,一套基础模型真的能通吃吗?
现在很多企业探索让自动驾驶和具身智能使用相似的基础模型。
小鹏已经将VLA 2.0、Robotaxi和人形机器人纳入Physical AI布局,并提出以物理世界基础模型支撑不同智能载体。
学术界也有研究让同一个模型跨越车辆、轮式机器人、无人机等不同载体完成导航任务。
汽车和机器人面对的环境、传感器、运动方式都不同,为什么还要尝试共用一套基础模型?
01 为什么汽车和机器人开始需要相似的基础模型?
过去,自动驾驶和机器人基本沿着各自的技术路线发展。
自动驾驶面对的是道路、车辆、行人、交通信号和复杂交通关系,需要持续完成环境感知、场景理解、行为预测、路径规划和车辆控制。
机器人面对的环境则更加多样,除了移动,还涉及目标识别、抓取、搬运、操作等任务。两者看起来差别很大,但从更底层的角度看,它们解决的都是一个相似问题,即如何让机器理解真实世界,并根据理解结果采取行动。

图片源自:网络
视觉语言动作模型(Vision-Language-Action,VLA)的出现,正好把这个问题进一步向前推进。
VLA不只是识别图像中的物体,而是尝试把视觉信息、任务目标和动作联系起来,让模型从看到了什么进一步走向接下来应该做什么。
对于汽车来说,模型需要理解道路环境、周围交通参与者以及当前驾驶任务,并据此形成驾驶行为;对于机器人来说,模型同样需要理解周围空间、任务要求和目标物体,再决定移动、抓取或者操作。
因此,真正值得被共享的并不是一整套完整的汽车模型或者机器人模型,而是视觉理解、空间关系理解、任务推理,以及对环境变化进行预测的能力等更基础的能力。
这种跨载体共享已经开始出现在一些具体的研究中。如ICLR 2026收录的Embodied Navigation Foundation Model(NavFoM)尝试使用统一架构处理四足机器人、无人机、轮式机器人和车辆等不同载体的导航任务,其中就包括自动驾驶场景。
02 能理解同一个世界不代表能执行同一个动作
汽车和机器人虽然都需要感知、理解、行动,但它们的动作空间完全不同。汽车的运动受到车辆尺寸、转向特性、动力学、道路结构以及交通规则等多重约束。
对于采用端到端或VLA架构的系统,模型可以直接生成未来一段时间的车辆轨迹,也可以先形成驾驶意图,再由后续模块完成轨迹生成和控制。
机器人则不同。
人形机器人可以控制身体、手臂和手部关节,机械臂需要处理末端执行器的空间位置,轮式机器人主要解决移动和导航问题。即使面对同一个物体,不同机器人的动作方式也可能完全不同。
所以,对于统一模型的研究,不能简单理解为一个模型能不能同时处理汽车和机器人,而是需要研究模型究竟能够统一到哪一层。
如前方存在障碍物、目标位于左侧、当前路径受到阻挡等语义信息,在不同物理载体之间具有较强的共通性。
对汽车而言,它可能意味着减速、停车、变道或者绕行,并需要生成符合车辆运动约束的轨迹;对轮式机器人而言,可能意味着重新规划移动路径;对带机械臂的机器人而言,还可能意味着改变操作方式或者直接移动障碍物。

图片源自:网络
因此,大模型统一的是靠近世界理解和任务推理的部分,而越靠近具体载体的动作生成与控制层,就越需要根据自身的身体结构、动力学和动作空间进行适配。
在机器人领域,这种思路已经有了实际落地。例如X-VLA通过Soft Prompt引入不同机器人硬件、传感器配置和数据域的信息,让同一个基础模型能够适应不同机器人,而不是要求所有机器人拥有完全相同的动作空间。
这也说明了一个重要问题,基础模型可以尽量统一,但不同的身体不能被忽略。
03 真正难的是让模型理解自己能做什么
汽车和机器人共享基础模型最困难的地方不是环境理解,而是具身差异。模型不仅要知道外部世界是什么样,还要知道自己的状态、运动能力和动作会受到什么限制。
如同样看到前方存在障碍物,汽车和机器人对这个信息的处理方式并不相同。
汽车行驶在道路上,需要结合道路边界、交通参与者、车辆自身尺寸、速度以及车辆动力学,判断减速、停车或者绕行是否可行。
它不能简单地把避开障碍物理解成向旁边移动,因为旁边可能存在其他车辆,也可能根本没有可行驶空间。某些机器人则可能拥有更加丰富的行动选择。
它可以停下来、转身、改变路径,部分具备操作能力的机器人甚至可以利用机械臂处理障碍物。但这些能力同样取决于机器人的具体结构、关节配置、负载能力和任务要求。

图片源自:网络
这也意味着,所谓物理智能不能只理解成对外部世界的理解。
它还需要回答我现在处于什么状态?我具备哪些能力?哪些动作是可执行的?执行这个动作之后,环境可能发生什么变化?
等多个问题。同样一句向前走,对于汽车、轮式机器人和人形机器人来说,并不是完全相同的动作。它们的身体结构不同,运动能力不同,传感器配置不同,与环境的交互方式也不同。
因此,如果未来真的出现一套同时服务自动驾驶和具身智能的基础模型,它需要处理的不只是一个统一的世界表示,还需要把不同物理载体的状态、能力和动作空间纳入模型体系。
这也是为什么当前Physical AI的研究和产业探索,会同时关注基础模型、VLA和世界模型。
模型需要逐渐从理解当前环境走向理解行动与环境变化之间的关系。
04 一套基础模型最终会通吃吗?
如果把通吃理解成一套完全相同的模型,不做任何适配,就直接控制汽车、机器人甚至其他智能设备,这条路线短期内并不现实。
但如果把通吃理解成不同物理智能体共享一个基础模型的部分核心能力,那么这条路线已经出现了比较明确的研究和产业探索。汽车仍然需要自己的车辆轨迹生成和控制能力,机器人也仍然需要适配自身的移动、操作和执行能力。
基础模型负责的可能是更上层的理解和推理,而不同的身体负责把这些能力转化为符合自身约束的具体动作。
换句话说,未来真正可能被统一的,不一定是怎么开车和怎么走路,而是它们背后更底层的智能能力。
这也是为什么越来越多自动驾驶企业进入具身智能领域的原因。
自动驾驶长期积累的感知、空间理解、预测、规划和实时决策能力,本身就是面向物理世界的一套技术积累;机器人面对的同样是真实环境中的感知、推理与行动问题。
一套基础模型通吃不是一个模型控制所有机器,而是汽车、机器人等不同物理智能体开始共享一个用于理解世界和进行推理的基础模型底座,同时保留各自与身体结构、动作空间和控制能力相关的适配层。
#自动驾驶 #具身智能 #大模型
原文标题 : 从自动驾驶到具身智能,一套基础模型真的能通吃吗?