特斯拉Optimus机器人自己学 VS 让人类拍视频教的Figure机器人

智车科技

5天前

模型先学习海量人类第一视角操作,建立对物体、任务、环境的理解,之后只需要少量真机数据微调,机器人就能快速学会新任务。...它的巨大优势:数据扩张极快,不需要等机器人硬件量产。...视频里是人类的骨骼、重量、肌肉力量;机器人是金属躯体、不同自由度、不同关节力矩。

一个让机器人自己干活学,一个靠普通人手机拍视频训练,人形机器人的训练路线,正在走向分叉路口。

当所有人形机器人厂商都卡在同一个瓶颈 ——物理交互数据严重不足,两大头部玩家走出了完全相反的两条路。

特斯拉Optimus选择自建训练场Optimus Academy,把一台台真机投入工厂真实环境,靠机器人亲自试错、采集真机交互数据;Figure则推出Index全球众包平台,付费招募全球普通人,用手机录制居家、工厂第一视角操作视频,用来预训练 Helix具身大模型。

两条路线,没有绝对对错,本质是成本、速度、物理真实性的取舍博弈,也是外网 X、Reddit人形板块近段时间持续热议的核心话题。

Optimus Academy真机试错,机器人在现实世界学习

特斯拉的逻辑,完全复刻 FSD 自动驾驶的数据飞轮思路:硬件本体才是最好的数据采集器。

弗里蒙特产线下线的所有 Gen3 Optimus,2026 年全部留在特斯拉内部,送入 Optimus Academy。机器人在工厂车间做物料搬运、零部件辅助装配、质检,一边干活,一边采集完整数据:图像、关节力矩、接触力、失败时的动力学反馈。

完整训练闭环:

先由人类操作员做示范遥操作,给模型基础任务先验;

大量 Optimus 真机集群在工厂真实环境反复执行任务;

成功案例、摔倒、抓取滑脱等全部失败数据统一回流;

模型迭代更新,再通过 OTA 下发给全部机器人,形成舰队共同进化。

这套路线的最大优势,彻底绕开仿真到现实的迁移鸿沟(Sim-to-Real Gap)。

所有数据都来自机器人本体的传感器与动力学反馈,采集到的是机器人真实物理身体和世界交互的一手信息。不会出现 “视频里人类能轻松拿起,机器人硬件尺寸、重量、关节刚度不一样,学不会” 的问题。同时复用 FSD 纯视觉、世界仿真器底座,汽车海量场景数据可以迁移给人形机器人。

但代价同样明显:重资产,慢起步,硬件产能直接限制数据规模。

要获得更多训练样本,就必须造出更多机器人。灵巧手良率、整机产能一旦卡壳,数据飞轮就无法快速扩大。外网争议点也集中于此:当前 FSD V14、Cybercab 优先级更高,算力与人力资源是否会分流,拖慢 Academy 的训练迭代速度。

适合场景:标准化工业场景、长期迭代、追求高可靠性;长期壁垒极高,但前期投入巨大、扩张速度慢。

Figure Index全球众包人类视频,用海量人类动作预训练模型

Figure 给出的是另一个更轻量化、快速扩量的解法:不用大量造机器人,先买全世界普通人的操作视频。

Index 是 Figure 推出的全球性数据众包平台,普通人注册成为创作者,手机或头戴设备录制第一视角干活视频,完成审核就能获得报酬。可以是叠衣服、整理厨房这类家务,也可以是工厂零部件搬运、仓库分拣等工业操作。

截至最新公开数据,Index 覆盖 108 个国家,周活贡献者近 7 万人,每秒新增 35 分钟物理交互视频,累计上传千万级视频片段;Figure 承诺未来一年,投入超 10 亿美元用于数据集与算力建设,数据送入 Helix 视觉 - 语言 - 动作(VLA)模型训练,目标实现零样本泛化。Figure机器人的“数据众包”正在飙升:一周7万人在给机器人录视频

Figure 的底层设想:人类的操作方式,本身就是物理世界最优的行为模板。模型先学习海量人类第一视角操作,建立对物体、任务、环境的理解,之后只需要少量真机数据微调,机器人就能快速学会新任务。

它的巨大优势:数据扩张极快,不需要等机器人硬件量产。哪怕只有少量样机,也能持续扩充模型见过的任务、物体、环境,快速覆盖海量多样化场景,尤其适合家庭非结构化环境。Figure 已经在宝马工厂长期落地机器人试点,走租赁交付模式,提前拿到外部付费场景。

外网最核心质疑,也是这条路线天生短板 ——域偏移(Domain Gap)。

视频里是人类的骨骼、重量、肌肉力量;机器人是金属躯体、不同自由度、不同关节力矩。人类能轻松完成的动作,直接迁移到机器人本体上会失效。视频只能教会模型 “任务应该怎么做”,但无法提供机器人本体受力、碰撞、抓取打滑的动力学数据。众包视频质量参差不齐,还需要投入大量算力做清洗、去重、标注,巨额算力投入带来巨大现金流压力。

适合场景:快速扩充任务多样性、泛化能力优先;低成本快速起步,但真机落地时,依然要补大量机器人本体交互数据。

两条路线核心对比,谁更容易跑通?

Optimus Academy(真机训练派)

优点:数据属于机器人本体,物理真实性强,仿真现实迁移 gap 小;FSD 数据底座复用,长期护城河强;真实工厂场景同步验证产品可用性。

短板:硬件先行,重资产;产能瓶颈直接限制数据量;单台采集成本高,场景扩张慢;算力人力存在被自动驾驶业务分流风险。

Figure Index(人类众包视频派)

优点:数据获取速度快,低成本快速覆盖海量任务与环境;不依赖机器人产能;Helix 模型架构擅长从视频学习操作,快速做零样本泛化。

短板:人类动作与机器人本体动力学存在天然鸿沟;视频缺少力反馈等物理信号;海量数据清洗、算力采购消耗巨额资金;真机验证环节依然绕不开。

外网社区目前形成一个共识:两条路线不是非此即彼,只是训练的主次优先级不同。

特斯拉 Optimus 也会使用人类示范视频作为初始预训练素材,但核心迭代靠真机试错;Figure 同样会使用工厂真机采集数据微调模型,Index 只是前期快速扩充场景多样性的手段。二者都属于 “混合训练”,只是侧重点天差地别。

哪条路才是具身智能最优解?

短期(1-2 年)来看,Figure 的 Index 路线会更容易做出丰富的演示效果。海量居家场景视频,能让 Helix 模型学会大量不同家务任务,快速在多样化环境里展示泛化能力,更容易拿到更多工厂试点订单。但当从 “演示” 走向连续稳定作业时,人类视频带来的域差距会成为硬门槛。

中长期(3-5 年),胜负关键回到硬件量产与真机数据闭环。

如果 Optimus Gen3 能够突破灵巧手良率瓶颈,大批量在特斯拉工厂内部部署,真机数据飞轮一旦全速转动,会形成极难追赶的壁垒。但前提是硬件产能、算力资源可以持续供给,不会被自动驾驶业务挤占资源。

人形机器人的终极目标,是能在无预设的现实世界稳定完成各类任务。不管是靠机器人亲自试错,还是学习人类视频,最终都必须落到真机物理交互数据上。Index 可以快速 “见多识广”,Optimus Academy 能让机器人亲手学会如何与真实世界的力、碰撞、形变打交道。

两条路线正在并行赛跑,当下没有标准答案。赛道真正的悬念,不在于演示视频有多惊艳,而在于:谁能以可控成本,持续拿到足够高质量的机器人本体物理交互数据。

#Optimus #figure #特斯拉机器人 #具身智能 #人形机器人 

关注「智财社」看具身智能技术迭代与资本脉络

原文标题 : 特斯拉Optimus机器人自己学 VS 让人类拍视频教的Figure机器人

模型先学习海量人类第一视角操作,建立对物体、任务、环境的理解,之后只需要少量真机数据微调,机器人就能快速学会新任务。...它的巨大优势:数据扩张极快,不需要等机器人硬件量产。...视频里是人类的骨骼、重量、肌肉力量;机器人是金属躯体、不同自由度、不同关节力矩。

一个让机器人自己干活学,一个靠普通人手机拍视频训练,人形机器人的训练路线,正在走向分叉路口。

当所有人形机器人厂商都卡在同一个瓶颈 ——物理交互数据严重不足,两大头部玩家走出了完全相反的两条路。

特斯拉Optimus选择自建训练场Optimus Academy,把一台台真机投入工厂真实环境,靠机器人亲自试错、采集真机交互数据;Figure则推出Index全球众包平台,付费招募全球普通人,用手机录制居家、工厂第一视角操作视频,用来预训练 Helix具身大模型。

两条路线,没有绝对对错,本质是成本、速度、物理真实性的取舍博弈,也是外网 X、Reddit人形板块近段时间持续热议的核心话题。

Optimus Academy真机试错,机器人在现实世界学习

特斯拉的逻辑,完全复刻 FSD 自动驾驶的数据飞轮思路:硬件本体才是最好的数据采集器。

弗里蒙特产线下线的所有 Gen3 Optimus,2026 年全部留在特斯拉内部,送入 Optimus Academy。机器人在工厂车间做物料搬运、零部件辅助装配、质检,一边干活,一边采集完整数据:图像、关节力矩、接触力、失败时的动力学反馈。

完整训练闭环:

先由人类操作员做示范遥操作,给模型基础任务先验;

大量 Optimus 真机集群在工厂真实环境反复执行任务;

成功案例、摔倒、抓取滑脱等全部失败数据统一回流;

模型迭代更新,再通过 OTA 下发给全部机器人,形成舰队共同进化。

这套路线的最大优势,彻底绕开仿真到现实的迁移鸿沟(Sim-to-Real Gap)。

所有数据都来自机器人本体的传感器与动力学反馈,采集到的是机器人真实物理身体和世界交互的一手信息。不会出现 “视频里人类能轻松拿起,机器人硬件尺寸、重量、关节刚度不一样,学不会” 的问题。同时复用 FSD 纯视觉、世界仿真器底座,汽车海量场景数据可以迁移给人形机器人。

但代价同样明显:重资产,慢起步,硬件产能直接限制数据规模。

要获得更多训练样本,就必须造出更多机器人。灵巧手良率、整机产能一旦卡壳,数据飞轮就无法快速扩大。外网争议点也集中于此:当前 FSD V14、Cybercab 优先级更高,算力与人力资源是否会分流,拖慢 Academy 的训练迭代速度。

适合场景:标准化工业场景、长期迭代、追求高可靠性;长期壁垒极高,但前期投入巨大、扩张速度慢。

Figure Index全球众包人类视频,用海量人类动作预训练模型

Figure 给出的是另一个更轻量化、快速扩量的解法:不用大量造机器人,先买全世界普通人的操作视频。

Index 是 Figure 推出的全球性数据众包平台,普通人注册成为创作者,手机或头戴设备录制第一视角干活视频,完成审核就能获得报酬。可以是叠衣服、整理厨房这类家务,也可以是工厂零部件搬运、仓库分拣等工业操作。

截至最新公开数据,Index 覆盖 108 个国家,周活贡献者近 7 万人,每秒新增 35 分钟物理交互视频,累计上传千万级视频片段;Figure 承诺未来一年,投入超 10 亿美元用于数据集与算力建设,数据送入 Helix 视觉 - 语言 - 动作(VLA)模型训练,目标实现零样本泛化。Figure机器人的“数据众包”正在飙升:一周7万人在给机器人录视频

Figure 的底层设想:人类的操作方式,本身就是物理世界最优的行为模板。模型先学习海量人类第一视角操作,建立对物体、任务、环境的理解,之后只需要少量真机数据微调,机器人就能快速学会新任务。

它的巨大优势:数据扩张极快,不需要等机器人硬件量产。哪怕只有少量样机,也能持续扩充模型见过的任务、物体、环境,快速覆盖海量多样化场景,尤其适合家庭非结构化环境。Figure 已经在宝马工厂长期落地机器人试点,走租赁交付模式,提前拿到外部付费场景。

外网最核心质疑,也是这条路线天生短板 ——域偏移(Domain Gap)。

视频里是人类的骨骼、重量、肌肉力量;机器人是金属躯体、不同自由度、不同关节力矩。人类能轻松完成的动作,直接迁移到机器人本体上会失效。视频只能教会模型 “任务应该怎么做”,但无法提供机器人本体受力、碰撞、抓取打滑的动力学数据。众包视频质量参差不齐,还需要投入大量算力做清洗、去重、标注,巨额算力投入带来巨大现金流压力。

适合场景:快速扩充任务多样性、泛化能力优先;低成本快速起步,但真机落地时,依然要补大量机器人本体交互数据。

两条路线核心对比,谁更容易跑通?

Optimus Academy(真机训练派)

优点:数据属于机器人本体,物理真实性强,仿真现实迁移 gap 小;FSD 数据底座复用,长期护城河强;真实工厂场景同步验证产品可用性。

短板:硬件先行,重资产;产能瓶颈直接限制数据量;单台采集成本高,场景扩张慢;算力人力存在被自动驾驶业务分流风险。

Figure Index(人类众包视频派)

优点:数据获取速度快,低成本快速覆盖海量任务与环境;不依赖机器人产能;Helix 模型架构擅长从视频学习操作,快速做零样本泛化。

短板:人类动作与机器人本体动力学存在天然鸿沟;视频缺少力反馈等物理信号;海量数据清洗、算力采购消耗巨额资金;真机验证环节依然绕不开。

外网社区目前形成一个共识:两条路线不是非此即彼,只是训练的主次优先级不同。

特斯拉 Optimus 也会使用人类示范视频作为初始预训练素材,但核心迭代靠真机试错;Figure 同样会使用工厂真机采集数据微调模型,Index 只是前期快速扩充场景多样性的手段。二者都属于 “混合训练”,只是侧重点天差地别。

哪条路才是具身智能最优解?

短期(1-2 年)来看,Figure 的 Index 路线会更容易做出丰富的演示效果。海量居家场景视频,能让 Helix 模型学会大量不同家务任务,快速在多样化环境里展示泛化能力,更容易拿到更多工厂试点订单。但当从 “演示” 走向连续稳定作业时,人类视频带来的域差距会成为硬门槛。

中长期(3-5 年),胜负关键回到硬件量产与真机数据闭环。

如果 Optimus Gen3 能够突破灵巧手良率瓶颈,大批量在特斯拉工厂内部部署,真机数据飞轮一旦全速转动,会形成极难追赶的壁垒。但前提是硬件产能、算力资源可以持续供给,不会被自动驾驶业务挤占资源。

人形机器人的终极目标,是能在无预设的现实世界稳定完成各类任务。不管是靠机器人亲自试错,还是学习人类视频,最终都必须落到真机物理交互数据上。Index 可以快速 “见多识广”,Optimus Academy 能让机器人亲手学会如何与真实世界的力、碰撞、形变打交道。

两条路线正在并行赛跑,当下没有标准答案。赛道真正的悬念,不在于演示视频有多惊艳,而在于:谁能以可控成本,持续拿到足够高质量的机器人本体物理交互数据。

#Optimus #figure #特斯拉机器人 #具身智能 #人形机器人 

关注「智财社」看具身智能技术迭代与资本脉络

原文标题 : 特斯拉Optimus机器人自己学 VS 让人类拍视频教的Figure机器人

展开
财经头条声明:所载内容仅为传递信息目的,非本站观点,亦非投资建议。据此操作,风险自负。 商务合作:app@feheadline.com
打开“财经头条”阅读更多精彩资讯
APP内打开