最近,赛迪研究院(中国电子信息产业发展研究院)发布了《具身智能技术与产业发展报告》。报告指出,全球具身智能竞争已从比拼单机演示效果,转向模型、数据、本体、仿真、评测、交付全链条体系能力的比拼。

在这场“大脑”的竞赛中,英伟达、谷歌、特斯拉三家美国企业各自选择了完全不同的技术路径。有趣的是,报告原文并未使用“三足鼎立”这一表述,而是客观分析了全球主要经济体的发展路线差异:
中国:“场景反向造模+整机小批量交付+全产业链国产化”
美国:“基础大模型+仿真平台+工业验证三位一体”
欧盟:“算力基建先行+规则治理前置”
日本、韩国:“依托制造业底座针对性布局”
三家美国企业的路线分化,恰好成为报告美国路线分析框架下最具代表性的案例,也为理解这场全球竞争提供了一个清晰的切面。
英伟达GROOT:做具身智能的“Android”
英伟达的策略最像智能手机时代的Android——不造机器人,只造机器人的“大脑”和工具链。

GROOT是英伟达专为人形机器人设计的通用基础模型,采用开放、可定制的策略,支持双系统认知架构——快速反射与深思熟虑规划的结合。模型支持多模态输入(语言、图像),通过强化学习与模仿学习的结合实现运动控制。
但GROOT真正的杀招不是模型本身,而是它背后的一整套工具链。

Isaac Sim/Lab提供仿真平台,让机器人在虚拟世界里先跑几百万次;Jetson Thor提供端侧算力硬件;Omniverse Blueprint和Newton物理引擎提供合成数据生成能力。2026年7月,英伟达还把GR00T N1.7(30亿参数的可商用VLA模型)和Isaac Teleop(开源遥操作数据采集框架)一起塞进了Hugging Face的开源机器人库LeRobot。一行pip install "lerobot[groot]",开发者就能加载英伟达的预训练检查点。
NVIDIA一侧有300万机器人开发者,Hugging Face一侧有1600万AI构建者。英伟达做的不是“造模型”,是“造生态”——把数据采集、模型训练、仿真验证和部署接入同一套开源工作流。

用赛迪研究院的话说,英伟达正在“把具身智能竞争上移到开发基础设施层”。不跟你比谁的机器人更漂亮,比谁的工具链更好用、谁的开源生态更活跃。GROOT的目标不是成为最好的模型,而是成为最多人用的模型。
特斯拉Optimus:做具身智能的“iPhone”
如果说英伟达是Android,特斯拉就是iPhone——软硬一体、数据闭环、端到端自研。
特斯拉Optimus不依赖任何外部模型。它的智能系统深度复用特斯拉FSD纯视觉AI大模型,搭载HW4.0视觉芯片与12颗摄像头,可在约0.3秒内完成“感知—决策—执行”闭环。特斯拉在CVPR 2026上明确表示:“我们不是在造一个驾驶产品,而是在为所有机器人构建一个统一的基础模型。同一套模型,今天开车,明天就在工厂里搬箱子。”

特斯拉的独特之处在于数据飞轮。全球已有约130万辆具备监督式自动驾驶能力的特斯拉在路上跑,FSD累计行驶里程已超过108亿英里。这些数据直接喂给Optimus的感知和决策模型。同一颗AI4芯片,既驱动车上的FSD,也驱动Optimus机器人。
特斯拉还成立了“Optimus Academy”训练场,机器人通过“尝试-失败-学习”的循环进行自我进化。马斯克预计AI5芯片在2027年中量产,将首先搭载在Optimus上。长期产能目标1000万台/年。
特斯拉的终极壁垒不是算法,是数据。别人在实验室里采数据,特斯拉的车队在真实道路上每天产生数百万英里的真实世界数据。这个差距,不是靠砸钱能短期追上的。
谷歌RT-2:做具身智能的“先行者”
谷歌是三条路线中最特殊的一个——它既不像英伟达那样做平台,也不像特斯拉那样做整机,而是专注于AI模型本身。
2023年7月,谷歌DeepMind推出RT-2,成为全球首个视觉-语言-动作(VLA)大模型。RT-2在机器人轨迹数据和互联网级别视觉语言任务上联合微调,参数量达550亿/120亿/50亿,性能较RT-1提升约3倍。它可以直接用复杂文本指令操控机械臂,实现符号理解、逻辑推理等能力。



2025年,谷歌将RT系列升级为Gemini Robotics,把Gemini 2.0的多模态推理能力扩展至机器人动作输出与空间推理。2026年,Gemini Robotics 2进一步实现全身协同控制,搭配ER 2具备长流程规划能力,象征人形机器人AI由单一动作迈向长时运作。
谷歌的技术路线是从互联网规模的数据中学习物理世界的规律——不依赖机器人本体采集数据,而是从海量文本、图像、视频中提取通用知识,再迁移到机器人控制中。这种路线的优势是泛化能力强,缺点是离真实物理世界有一定距离。
赛迪研究院指出,谷歌正从自研本体转向聚焦AI模型和算法研发。谷歌不打算造机器人,它打算让所有机器人都用上谷歌的“大脑”。
三条路线之外:国内玩家在追赶
赛迪报告同时指出,国内企业正在加速追赶,但路径与美国三家企业截然不同。
优必选Walker系列搭载自研BrainNet AI系统(含云端Super Brain和板载Smart Cerebellum),强调感知、决策、控制一体化。智元机器人自研WorkGPT多模态大模型,采用“云端超脑-主脑-子脑-脑干”认知架构。宇树科技自研UnifoLM机器人大模型,整合AI深度学习、计算机视觉、语音识别。
但赛迪报告特别指出,国内在软件平台与操作系统方面仍有差距。高质量训练数据不足、采集成本高、标注难度大,是国内人形机器人AI能力提升的关键瓶颈。此外,在VLA模型与基础算法、高端传感器、AI训练芯片算力等维度仍存在一定差距。报告将国内路线概括为“场景反向造模+整机小批量交付+全产业链国产化”——以应用场景拉动技术迭代,而非像美国那样从底层模型出发。
报告判断,中国在与美国竞争中,“硬件供应链优势明显,但AI软件生态尚需追赶。”
三条路,谁能走到终点?
英伟达、谷歌、特斯拉——三条路线代表了具身智能“大脑”的三种可能终局。
英伟达押注“开放生态”:不造机器人,只造工具链和平台。如果具身智能的“大脑”最终像Android一样被少数平台垄断,英伟达就是那个平台。
特斯拉押注“闭环系统”:软硬一体、数据自产、算法自研。如果具身智能的终极形态是“一台能自己进化、自己产生数据的机器人”,特斯拉的飞轮无人能及。
谷歌押注“模型先行”:专注于从互联网数据中学习物理世界的通用规律。如果具身智能的“大脑”最终像大语言模型一样,一个通用模型就能解决所有问题,谷歌就是那个模型的提供者。
赛迪研究院的判断是:全球竞争焦点已经从样机演示转向数据、模型、本体、工具链、场景和标准的全链条能力。三条路线没有绝对的对错。真正决定胜负的,不是谁的技术更先进,而是谁能在“数据-模型-硬件”这个闭环中跑得更快、更稳、更便宜。而这场竞赛的终局,可能要到2030年才能真正看清。
关注「智财社」看具身智能技术迭代与资本脉络
原文标题 : 赛迪研究院:英伟达、谷歌、特斯拉,谁在定义具身智能的“大脑”?
最近,赛迪研究院(中国电子信息产业发展研究院)发布了《具身智能技术与产业发展报告》。报告指出,全球具身智能竞争已从比拼单机演示效果,转向模型、数据、本体、仿真、评测、交付全链条体系能力的比拼。

在这场“大脑”的竞赛中,英伟达、谷歌、特斯拉三家美国企业各自选择了完全不同的技术路径。有趣的是,报告原文并未使用“三足鼎立”这一表述,而是客观分析了全球主要经济体的发展路线差异:
中国:“场景反向造模+整机小批量交付+全产业链国产化”
美国:“基础大模型+仿真平台+工业验证三位一体”
欧盟:“算力基建先行+规则治理前置”
日本、韩国:“依托制造业底座针对性布局”
三家美国企业的路线分化,恰好成为报告美国路线分析框架下最具代表性的案例,也为理解这场全球竞争提供了一个清晰的切面。
英伟达GROOT:做具身智能的“Android”
英伟达的策略最像智能手机时代的Android——不造机器人,只造机器人的“大脑”和工具链。

GROOT是英伟达专为人形机器人设计的通用基础模型,采用开放、可定制的策略,支持双系统认知架构——快速反射与深思熟虑规划的结合。模型支持多模态输入(语言、图像),通过强化学习与模仿学习的结合实现运动控制。
但GROOT真正的杀招不是模型本身,而是它背后的一整套工具链。

Isaac Sim/Lab提供仿真平台,让机器人在虚拟世界里先跑几百万次;Jetson Thor提供端侧算力硬件;Omniverse Blueprint和Newton物理引擎提供合成数据生成能力。2026年7月,英伟达还把GR00T N1.7(30亿参数的可商用VLA模型)和Isaac Teleop(开源遥操作数据采集框架)一起塞进了Hugging Face的开源机器人库LeRobot。一行pip install "lerobot[groot]",开发者就能加载英伟达的预训练检查点。
NVIDIA一侧有300万机器人开发者,Hugging Face一侧有1600万AI构建者。英伟达做的不是“造模型”,是“造生态”——把数据采集、模型训练、仿真验证和部署接入同一套开源工作流。

用赛迪研究院的话说,英伟达正在“把具身智能竞争上移到开发基础设施层”。不跟你比谁的机器人更漂亮,比谁的工具链更好用、谁的开源生态更活跃。GROOT的目标不是成为最好的模型,而是成为最多人用的模型。
特斯拉Optimus:做具身智能的“iPhone”
如果说英伟达是Android,特斯拉就是iPhone——软硬一体、数据闭环、端到端自研。
特斯拉Optimus不依赖任何外部模型。它的智能系统深度复用特斯拉FSD纯视觉AI大模型,搭载HW4.0视觉芯片与12颗摄像头,可在约0.3秒内完成“感知—决策—执行”闭环。特斯拉在CVPR 2026上明确表示:“我们不是在造一个驾驶产品,而是在为所有机器人构建一个统一的基础模型。同一套模型,今天开车,明天就在工厂里搬箱子。”

特斯拉的独特之处在于数据飞轮。全球已有约130万辆具备监督式自动驾驶能力的特斯拉在路上跑,FSD累计行驶里程已超过108亿英里。这些数据直接喂给Optimus的感知和决策模型。同一颗AI4芯片,既驱动车上的FSD,也驱动Optimus机器人。
特斯拉还成立了“Optimus Academy”训练场,机器人通过“尝试-失败-学习”的循环进行自我进化。马斯克预计AI5芯片在2027年中量产,将首先搭载在Optimus上。长期产能目标1000万台/年。
特斯拉的终极壁垒不是算法,是数据。别人在实验室里采数据,特斯拉的车队在真实道路上每天产生数百万英里的真实世界数据。这个差距,不是靠砸钱能短期追上的。
谷歌RT-2:做具身智能的“先行者”
谷歌是三条路线中最特殊的一个——它既不像英伟达那样做平台,也不像特斯拉那样做整机,而是专注于AI模型本身。
2023年7月,谷歌DeepMind推出RT-2,成为全球首个视觉-语言-动作(VLA)大模型。RT-2在机器人轨迹数据和互联网级别视觉语言任务上联合微调,参数量达550亿/120亿/50亿,性能较RT-1提升约3倍。它可以直接用复杂文本指令操控机械臂,实现符号理解、逻辑推理等能力。



2025年,谷歌将RT系列升级为Gemini Robotics,把Gemini 2.0的多模态推理能力扩展至机器人动作输出与空间推理。2026年,Gemini Robotics 2进一步实现全身协同控制,搭配ER 2具备长流程规划能力,象征人形机器人AI由单一动作迈向长时运作。
谷歌的技术路线是从互联网规模的数据中学习物理世界的规律——不依赖机器人本体采集数据,而是从海量文本、图像、视频中提取通用知识,再迁移到机器人控制中。这种路线的优势是泛化能力强,缺点是离真实物理世界有一定距离。
赛迪研究院指出,谷歌正从自研本体转向聚焦AI模型和算法研发。谷歌不打算造机器人,它打算让所有机器人都用上谷歌的“大脑”。
三条路线之外:国内玩家在追赶
赛迪报告同时指出,国内企业正在加速追赶,但路径与美国三家企业截然不同。
优必选Walker系列搭载自研BrainNet AI系统(含云端Super Brain和板载Smart Cerebellum),强调感知、决策、控制一体化。智元机器人自研WorkGPT多模态大模型,采用“云端超脑-主脑-子脑-脑干”认知架构。宇树科技自研UnifoLM机器人大模型,整合AI深度学习、计算机视觉、语音识别。
但赛迪报告特别指出,国内在软件平台与操作系统方面仍有差距。高质量训练数据不足、采集成本高、标注难度大,是国内人形机器人AI能力提升的关键瓶颈。此外,在VLA模型与基础算法、高端传感器、AI训练芯片算力等维度仍存在一定差距。报告将国内路线概括为“场景反向造模+整机小批量交付+全产业链国产化”——以应用场景拉动技术迭代,而非像美国那样从底层模型出发。
报告判断,中国在与美国竞争中,“硬件供应链优势明显,但AI软件生态尚需追赶。”
三条路,谁能走到终点?
英伟达、谷歌、特斯拉——三条路线代表了具身智能“大脑”的三种可能终局。
英伟达押注“开放生态”:不造机器人,只造工具链和平台。如果具身智能的“大脑”最终像Android一样被少数平台垄断,英伟达就是那个平台。
特斯拉押注“闭环系统”:软硬一体、数据自产、算法自研。如果具身智能的终极形态是“一台能自己进化、自己产生数据的机器人”,特斯拉的飞轮无人能及。
谷歌押注“模型先行”:专注于从互联网数据中学习物理世界的通用规律。如果具身智能的“大脑”最终像大语言模型一样,一个通用模型就能解决所有问题,谷歌就是那个模型的提供者。
赛迪研究院的判断是:全球竞争焦点已经从样机演示转向数据、模型、本体、工具链、场景和标准的全链条能力。三条路线没有绝对的对错。真正决定胜负的,不是谁的技术更先进,而是谁能在“数据-模型-硬件”这个闭环中跑得更快、更稳、更便宜。而这场竞赛的终局,可能要到2030年才能真正看清。
关注「智财社」看具身智能技术迭代与资本脉络
原文标题 : 赛迪研究院:英伟达、谷歌、特斯拉,谁在定义具身智能的“大脑”?