告别图像优先: 机器人视觉正在经历一场底层重构

智车科技

2周前

DINOv3等通用视觉基础模型在图像分类、检测、分割等任务上展现了惊人的能力。...但问题在于,这些模型的设计目标是理解图像内容,也就是回答图像里有什么,跟现在机器人落地的技能需求并不匹配。

作者|毛心如

当一台机器人真正进入工厂或真实环境时,视觉能力的差距往往不是体现在认不认识,而是体现在敢不敢动

在蚂蚁灵波最新发布的 LingBot-Depth 2.0 的演示中,这种差距被直观地放大了出来:同样的场景下,深度图的边界更加干净,细小结构不再轻易丢失,远处区域也依然稳定可用。

这些变化看似只是视觉效果的提升,但对机器人来说,意义完全不同。

机器人并不是在看图,而是在依赖这些信息做决策。

边界模糊一点,抓取就可能偏移;远距离不稳定,路径规划就会滞后;细小结构丢失,风险就会被忽略。

也正因为如此,LingBot-Depth 2.0 的提升,并不是简单的精度优化,而是让深度信息第一次更接近可执行的状态。

但如果进一步追问,这种变化从何而来,就会发现答案并不只在深度模型本身。

蚂蚁灵波并没有沿用通用视觉模型,而是从头预训练了自己的视觉基础模型 LingBot-Vision,用来替代 DINOv3 等通用方案,并将其开源。

换句话说,LingBot-Depth 2.0 的提升,本质上来自一次更底层的改变:机器人视觉不再围绕图像语义,而是围绕空间本身重建。

让机器人真正看清三维世界

在所有机器人任务中,深度感知是最基础的一环。

抓取需要知道物体有多远、边界在哪里;移动需要判断通道是否可通行、远处有没有障碍;避障需要在复杂环境中持续感知空间结构的变化。

如果深度结果不稳定,机器人的后续决策就会像站在摇晃的地基上盖房子,随时可能出问题。

LingBot-Depth 2.0 的变化就是围绕这一点展开。

相比上一版本,它集中解决了几个长期困扰实际应用的问题,使深度结果从可以生成走向可以执行。

最直观的变化体现在边界上。

传统深度模型往往在物体边缘区域出现模糊甚至粘连,这种现象在视觉上并不显眼,但在机器人执行中却会被不断放大。

抓取位置的偏移、避障判断的误差,往往就来自这些细微的不确定性。

LingBot-Depth 2.0 在这一点上的改进,使物体轮廓更加完整,前景与背景的分离也更加清晰,从而为后续操作提供了更稳定的基础。

注:香槟塔场景是深度感知的一道难题,杯壁是透明的,光线会穿透;液面是流动的,反射会变化;杯子前后堆叠,轮廓极易粘连。LingBot-Depth 2.0 深度图显示,模型不仅完整保留了每一只高脚杯的精细轮廓,且在流动液面区域未产生空洞,在杯体重叠处保持了严格的几何边界分离。

与边界相伴的,是对细小结构的处理能力。

真实环境中,大量关键物体并不以规则大体积出现,而是以线缆、细杆或小尺寸目标的形式存在。

过去,这类结构往往难以被稳定捕捉,导致系统在关键时刻看不见风险。

在新的版本中,这些细节开始被持续保留下来,深度图不再轻易丢失这些信息,这使得模型在复杂环境中的可靠性有了明显提升

另一个重要变化发生在距离维度

传统深度模型在远距离区域容易出现噪声,使系统只能在接近目标后才进行有效决策,这种被动反应会压缩机器人可用的决策时间。

LingBot-Depth 2.0 通过提升远距离区域的稳定性,使路径规划可以更早发生,整个决策过程也因此变得更加从容。

当场景进一步复杂化时,模型的表现差异会更加明显。

玻璃、反光材质、遮挡结构以及非均匀光照,长期以来都是深度模型的薄弱环节。

在这些情况下,深度图容易出现破碎、空洞甚至局部失效。

LingBot-Depth 2.0 在这些场景中的表现,更接近一种连续的空间重建,结果不再频繁断裂,从而能够支持机器人完成更长时间的连续任务。

注:该场景同时包含动态薄层柔性物(飘动窗帘)与高密度异构杂乱物体(电脑、书本、线缆等),是深度感知的典型复合难题。LingBot-Depth 2.0深度图显示:飘窗帘皱褶轮廓完整捕捉,帧间时序稳定无拖影;桌面的多尺度物体均保持清晰几何边界,无空洞、无粘连、无漏检。模型对薄层与细物的泛化能力,使深度信息在非结构化居家/办公场景下依然具备像素级可靠度。

在权威评测中,LingBot-Depth 2.0 在 NYUv2 等 16 个主流深度评测数据集上拿下 12 个第一,室内场景相对误差(REL)降低超过 70%。

尤其在透明物体、镜面反射等公认的老大难场景上,它的表现明显优于现有主流方案。

更重要的是,LingBot-Depth 2.0 的升级不是孤立的算法调优。

它的底层能力,来自一个更大的技术决策,蚂蚁灵波选择从头训练自己的视觉基础模型,而不是继续依赖通用的互联网图像模型。

从底层重塑机器人视觉

LingBot-Depth 2.0 的优秀表现,离不开底层LingBot-Vision 的支撑。

蚂蚁灵波从零自主预训练了这一面向具身智能的空间原生视觉基础模型,替代了传统 DINOv3 等通用视觉基模,并同步开源。

过去几年,DINOv3 等通用视觉基础模型在图像分类、检测、分割等任务上展现了惊人的能力。

它们通过在海量互联网图像上进行自监督预训练,学会了非常丰富的视觉语义表征。

但问题在于,这些模型的设计目标是理解图像内容,也就是回答图像里有什么,跟现在机器人落地的技能需求并不匹配。

LingBot-Vision的设计出发点完全不同。

它从一开始就不是为图像理解而生的,而是面向机器人在物理世界中的交互需求设计的。

蚂蚁灵波团队在自监督学习框架中引入了 Boundary Forcing(边界强制)机制。

通俗来说,大多数通用视觉模型训练时采用随机掩码的方式,挖掉图片里随机的小方块,让模型去猜缺了什么。

这个过程好比给你一篇布满马赛克的文字让你凭感觉补全,模型学到的是图像整体的语义规律。

而 LingBot-Vision 在训练时专门针对物体边缘和轮廓的像素进行掩码,强迫模型去理解这个物体的边界在哪里、它的形状是什么、不同部分之间是什么空间关系。

这一机制带来了根本性的变化。

传统模型学到的是图像级的语义表征,LingBot-Vision 还学到了像素级的几何表征

前者适合做图像描述,后者适合做机器人操作。

效果也直接体现在数据上。

在公开基准测试中,约 11 亿参数的 LingBot-Vision 以约七分之一的参数量,性能比得上 70 亿参数的 DINOv3,甚至模型预训练语料约 1.6 亿张图像,不足 DINOv3 的三分之一。

这意味着蚂蚁灵波用更少的数据和更小的模型,训练出了更适合机器人任务的空间视觉表征。

更值得一提的是,LingBot-Vision 还提供了面向端侧部署的轻量版本

其中 3 亿参数的 ViT-L 模型在 NYUv2 深度估计任务上,精度与 70 亿参数的 DINOv3 相当,参数量仅为其二十三分之一。

这对人形机器人、小型服务机器人等算力和功耗受限的设备来说,是真正的实用价值。

而 LingBot-Depth 2.0,正是建立在这个空间原生底座之上的第一个关键验证

它证明了 LingBot-Vision 学到的几何表征能够有效迁移到深度感知任务中,并且效果显著优于依赖通用视觉模型的方案。

更重要的是,除了深度估计,开发者还可以基于 LingBot-Vision 做自己的下游任务,6D 姿态估计、SLAM、抓取规划、空间重建。

总体来看,这套底座形成了具身原生视觉基模 rarr; 空间感知能力rarr; 机器人任务落地的清晰技术路线。

软硬一体化,打通商业化通路

技术路线的价值,最终要在产业里证明。

LingBot-Depth 系列虽然发布不久,但已经走通了从模型到商业化落地的路径

蚂蚁灵波与奥比中光的合作,提供了一个足够具体的参照。

奥比中光是行业领先的 AI 和机器人 3D 视觉企业。在双方的合作中,LingBot-Depth 2.0 模型与奥比中光的 Gemini 330 系列双目 3D 相机深度适配

相机提供芯片级原始深度数据,LingBot-Depth 2.0 在此基础上进行空间感知增强,例如边缘补全、细节优化、复杂场景下的深度图修复,最终输出的深度信息质量远优于裸硬件方案

更重要的是,这套组合已经在实际项目中通过了验证。

LingBot-Depth 2.0 已通过奥比中光深度视觉实验室的专业认证,在精度、稳定性及复杂场景适应性方面均达到行业领先水平。

在实际测试中,无论是细小物体的轮廓完整性、远距离目标的深度稳定性,还是反光、透明等复杂材质场景下的数据可靠性,LingBot-Depth 2.0 都表现出了明显优势。

双方的合作正在从技术验证走向产品化。

数据采集侧,奥比中光基于 LingBot-Depth 2.0 的 API 推出了 EGO-RGBD 数采设备,专门面向具身智能模型训练提供第一视角的高质量 RGB-D 数据。

在应用侧,奥比中光已推出集成 LingBot-Depth 最新版本模型能力的 SDK,形成 Orbbec 硬件+ LingBot-Depth 能力的联合产品方案

更长期来看,双方计划在今年年底推出集成 LingBot-Depth 商业版的一体化相机产品,实现 3D 相机+空间感知能力的一体化交付。

这意味着机器人客户不再需要自己动手做算法适配,硬件买回去,空间感知能力已经内置好了。

从 API 到 SDK 再到一体化相机,这条产品化路径清晰而务实。

与此同时,蚂蚁灵波选择将 LingBot-Vision 开源。

开源表面看是代码开放,实质上是一次产业基础设施的共建。能力变成行业共用底座,开发者不用重复造轮子;下游企业验证速度加快,从研发到落地的周期显著缩短。

回到最初的问题:机器人为什么看见了,却仍然难以行动?

答案逐渐明朗,问题不在于识别能力不够,而在于视觉系统缺乏对空间的原生理解

当视觉模型的目标仍然停留在图像语义时,它很难支撑真实世界中的交互需求;而当空间结构被放到更核心的位置,一整套能力体系也随之发生变化。

从这一角度看,LingBot-Vision 与 LingBot-Depth 2.0 的发布,并不只是两个模型的推出,而更像是一个信号:视觉正在从图像优先的范式,转向空间优先的重构路径。

而这条路径,恰恰是具身智能走向规模化落地所必须跨越的一步。

这一阶段的关键变化,并不是模型参数变得更大,也不是任务指标进一步提升,而是视觉真正开始服务于物理世界本身。

原文标题 : 告别图像优先:机器人视觉正在经历一场底层重构

DINOv3等通用视觉基础模型在图像分类、检测、分割等任务上展现了惊人的能力。...但问题在于,这些模型的设计目标是理解图像内容,也就是回答图像里有什么,跟现在机器人落地的技能需求并不匹配。

作者|毛心如

当一台机器人真正进入工厂或真实环境时,视觉能力的差距往往不是体现在认不认识,而是体现在敢不敢动

在蚂蚁灵波最新发布的 LingBot-Depth 2.0 的演示中,这种差距被直观地放大了出来:同样的场景下,深度图的边界更加干净,细小结构不再轻易丢失,远处区域也依然稳定可用。

这些变化看似只是视觉效果的提升,但对机器人来说,意义完全不同。

机器人并不是在看图,而是在依赖这些信息做决策。

边界模糊一点,抓取就可能偏移;远距离不稳定,路径规划就会滞后;细小结构丢失,风险就会被忽略。

也正因为如此,LingBot-Depth 2.0 的提升,并不是简单的精度优化,而是让深度信息第一次更接近可执行的状态。

但如果进一步追问,这种变化从何而来,就会发现答案并不只在深度模型本身。

蚂蚁灵波并没有沿用通用视觉模型,而是从头预训练了自己的视觉基础模型 LingBot-Vision,用来替代 DINOv3 等通用方案,并将其开源。

换句话说,LingBot-Depth 2.0 的提升,本质上来自一次更底层的改变:机器人视觉不再围绕图像语义,而是围绕空间本身重建。

让机器人真正看清三维世界

在所有机器人任务中,深度感知是最基础的一环。

抓取需要知道物体有多远、边界在哪里;移动需要判断通道是否可通行、远处有没有障碍;避障需要在复杂环境中持续感知空间结构的变化。

如果深度结果不稳定,机器人的后续决策就会像站在摇晃的地基上盖房子,随时可能出问题。

LingBot-Depth 2.0 的变化就是围绕这一点展开。

相比上一版本,它集中解决了几个长期困扰实际应用的问题,使深度结果从可以生成走向可以执行。

最直观的变化体现在边界上。

传统深度模型往往在物体边缘区域出现模糊甚至粘连,这种现象在视觉上并不显眼,但在机器人执行中却会被不断放大。

抓取位置的偏移、避障判断的误差,往往就来自这些细微的不确定性。

LingBot-Depth 2.0 在这一点上的改进,使物体轮廓更加完整,前景与背景的分离也更加清晰,从而为后续操作提供了更稳定的基础。

注:香槟塔场景是深度感知的一道难题,杯壁是透明的,光线会穿透;液面是流动的,反射会变化;杯子前后堆叠,轮廓极易粘连。LingBot-Depth 2.0 深度图显示,模型不仅完整保留了每一只高脚杯的精细轮廓,且在流动液面区域未产生空洞,在杯体重叠处保持了严格的几何边界分离。

与边界相伴的,是对细小结构的处理能力。

真实环境中,大量关键物体并不以规则大体积出现,而是以线缆、细杆或小尺寸目标的形式存在。

过去,这类结构往往难以被稳定捕捉,导致系统在关键时刻看不见风险。

在新的版本中,这些细节开始被持续保留下来,深度图不再轻易丢失这些信息,这使得模型在复杂环境中的可靠性有了明显提升

另一个重要变化发生在距离维度

传统深度模型在远距离区域容易出现噪声,使系统只能在接近目标后才进行有效决策,这种被动反应会压缩机器人可用的决策时间。

LingBot-Depth 2.0 通过提升远距离区域的稳定性,使路径规划可以更早发生,整个决策过程也因此变得更加从容。

当场景进一步复杂化时,模型的表现差异会更加明显。

玻璃、反光材质、遮挡结构以及非均匀光照,长期以来都是深度模型的薄弱环节。

在这些情况下,深度图容易出现破碎、空洞甚至局部失效。

LingBot-Depth 2.0 在这些场景中的表现,更接近一种连续的空间重建,结果不再频繁断裂,从而能够支持机器人完成更长时间的连续任务。

注:该场景同时包含动态薄层柔性物(飘动窗帘)与高密度异构杂乱物体(电脑、书本、线缆等),是深度感知的典型复合难题。LingBot-Depth 2.0深度图显示:飘窗帘皱褶轮廓完整捕捉,帧间时序稳定无拖影;桌面的多尺度物体均保持清晰几何边界,无空洞、无粘连、无漏检。模型对薄层与细物的泛化能力,使深度信息在非结构化居家/办公场景下依然具备像素级可靠度。

在权威评测中,LingBot-Depth 2.0 在 NYUv2 等 16 个主流深度评测数据集上拿下 12 个第一,室内场景相对误差(REL)降低超过 70%。

尤其在透明物体、镜面反射等公认的老大难场景上,它的表现明显优于现有主流方案。

更重要的是,LingBot-Depth 2.0 的升级不是孤立的算法调优。

它的底层能力,来自一个更大的技术决策,蚂蚁灵波选择从头训练自己的视觉基础模型,而不是继续依赖通用的互联网图像模型。

从底层重塑机器人视觉

LingBot-Depth 2.0 的优秀表现,离不开底层LingBot-Vision 的支撑。

蚂蚁灵波从零自主预训练了这一面向具身智能的空间原生视觉基础模型,替代了传统 DINOv3 等通用视觉基模,并同步开源。

过去几年,DINOv3 等通用视觉基础模型在图像分类、检测、分割等任务上展现了惊人的能力。

它们通过在海量互联网图像上进行自监督预训练,学会了非常丰富的视觉语义表征。

但问题在于,这些模型的设计目标是理解图像内容,也就是回答图像里有什么,跟现在机器人落地的技能需求并不匹配。

LingBot-Vision的设计出发点完全不同。

它从一开始就不是为图像理解而生的,而是面向机器人在物理世界中的交互需求设计的。

蚂蚁灵波团队在自监督学习框架中引入了 Boundary Forcing(边界强制)机制。

通俗来说,大多数通用视觉模型训练时采用随机掩码的方式,挖掉图片里随机的小方块,让模型去猜缺了什么。

这个过程好比给你一篇布满马赛克的文字让你凭感觉补全,模型学到的是图像整体的语义规律。

而 LingBot-Vision 在训练时专门针对物体边缘和轮廓的像素进行掩码,强迫模型去理解这个物体的边界在哪里、它的形状是什么、不同部分之间是什么空间关系。

这一机制带来了根本性的变化。

传统模型学到的是图像级的语义表征,LingBot-Vision 还学到了像素级的几何表征

前者适合做图像描述,后者适合做机器人操作。

效果也直接体现在数据上。

在公开基准测试中,约 11 亿参数的 LingBot-Vision 以约七分之一的参数量,性能比得上 70 亿参数的 DINOv3,甚至模型预训练语料约 1.6 亿张图像,不足 DINOv3 的三分之一。

这意味着蚂蚁灵波用更少的数据和更小的模型,训练出了更适合机器人任务的空间视觉表征。

更值得一提的是,LingBot-Vision 还提供了面向端侧部署的轻量版本

其中 3 亿参数的 ViT-L 模型在 NYUv2 深度估计任务上,精度与 70 亿参数的 DINOv3 相当,参数量仅为其二十三分之一。

这对人形机器人、小型服务机器人等算力和功耗受限的设备来说,是真正的实用价值。

而 LingBot-Depth 2.0,正是建立在这个空间原生底座之上的第一个关键验证

它证明了 LingBot-Vision 学到的几何表征能够有效迁移到深度感知任务中,并且效果显著优于依赖通用视觉模型的方案。

更重要的是,除了深度估计,开发者还可以基于 LingBot-Vision 做自己的下游任务,6D 姿态估计、SLAM、抓取规划、空间重建。

总体来看,这套底座形成了具身原生视觉基模 rarr; 空间感知能力rarr; 机器人任务落地的清晰技术路线。

软硬一体化,打通商业化通路

技术路线的价值,最终要在产业里证明。

LingBot-Depth 系列虽然发布不久,但已经走通了从模型到商业化落地的路径

蚂蚁灵波与奥比中光的合作,提供了一个足够具体的参照。

奥比中光是行业领先的 AI 和机器人 3D 视觉企业。在双方的合作中,LingBot-Depth 2.0 模型与奥比中光的 Gemini 330 系列双目 3D 相机深度适配

相机提供芯片级原始深度数据,LingBot-Depth 2.0 在此基础上进行空间感知增强,例如边缘补全、细节优化、复杂场景下的深度图修复,最终输出的深度信息质量远优于裸硬件方案

更重要的是,这套组合已经在实际项目中通过了验证。

LingBot-Depth 2.0 已通过奥比中光深度视觉实验室的专业认证,在精度、稳定性及复杂场景适应性方面均达到行业领先水平。

在实际测试中,无论是细小物体的轮廓完整性、远距离目标的深度稳定性,还是反光、透明等复杂材质场景下的数据可靠性,LingBot-Depth 2.0 都表现出了明显优势。

双方的合作正在从技术验证走向产品化。

数据采集侧,奥比中光基于 LingBot-Depth 2.0 的 API 推出了 EGO-RGBD 数采设备,专门面向具身智能模型训练提供第一视角的高质量 RGB-D 数据。

在应用侧,奥比中光已推出集成 LingBot-Depth 最新版本模型能力的 SDK,形成 Orbbec 硬件+ LingBot-Depth 能力的联合产品方案

更长期来看,双方计划在今年年底推出集成 LingBot-Depth 商业版的一体化相机产品,实现 3D 相机+空间感知能力的一体化交付。

这意味着机器人客户不再需要自己动手做算法适配,硬件买回去,空间感知能力已经内置好了。

从 API 到 SDK 再到一体化相机,这条产品化路径清晰而务实。

与此同时,蚂蚁灵波选择将 LingBot-Vision 开源。

开源表面看是代码开放,实质上是一次产业基础设施的共建。能力变成行业共用底座,开发者不用重复造轮子;下游企业验证速度加快,从研发到落地的周期显著缩短。

回到最初的问题:机器人为什么看见了,却仍然难以行动?

答案逐渐明朗,问题不在于识别能力不够,而在于视觉系统缺乏对空间的原生理解

当视觉模型的目标仍然停留在图像语义时,它很难支撑真实世界中的交互需求;而当空间结构被放到更核心的位置,一整套能力体系也随之发生变化。

从这一角度看,LingBot-Vision 与 LingBot-Depth 2.0 的发布,并不只是两个模型的推出,而更像是一个信号:视觉正在从图像优先的范式,转向空间优先的重构路径。

而这条路径,恰恰是具身智能走向规模化落地所必须跨越的一步。

这一阶段的关键变化,并不是模型参数变得更大,也不是任务指标进一步提升,而是视觉真正开始服务于物理世界本身。

原文标题 : 告别图像优先:机器人视觉正在经历一场底层重构

展开
财经头条声明:所载内容仅为传递信息目的,非本站观点,亦非投资建议。据此操作,风险自负。 商务合作:app@feheadline.com
打开“财经头条”阅读更多精彩资讯
APP内打开