蚂蚁集团旗下具身AI公司Robbyant近日宣布推出新一代空间感知模型LingBot-Depth 2.0,以及与之配套的视觉基础模型LingBot-Vision,标志着机器人空间感知能力迈上新台阶,帮助机器人更准确地理解并适应现实物理世界。
LingBot-Depth 2.0的技术突破
LingBot-Depth此前率先采用掩码深度建模(MDM)技术,有效解决了透明和反光表面的深度感知难题。LingBot-Depth 2.0在此基础上大幅扩展了训练数据规模与性能表现。该模型共使用1.5亿样本进行训练,在16项深度补全基准测试中,有12项取得领先排名。在最具挑战性的室内大范围深度缺失场景中,LingBot-Depth 2.0的深度误差较前代降低了一半,RMSE从0.132降至0.062。此外,该模型在传统深度相机容易失效的场景中表现尤为突出,例如玻璃、镜面及透明物体的识别与感知。
LingBot-Vision:行业首个以"边界结构"为预训练目标的视觉基础模型
上述突破的核心驱动力,是Robbyant全新推出的视觉基础模型LingBot-Vision。该模型是业内首个以"边界结构"作为预训练目标的视觉基础模型,具备亚像素级边界定位能力和空间结构理解能力,为稳健的空间感知提供了精确的视觉表征支撑。
值得关注的是,LingBot-Vision的预训练数据集仅包含1.6亿张图像,规模比DINOv3小一个数量级,但仍实现了高水平的性能表现。同时,该模型还具备高度稳定的物体边界判断能力,可在视频中对物体边界进行持续追踪。LingBot-Vision共发布ViT-G/L/B/S四个版本,其中L版本在NYUv2深度估计基准测试上的精度与DINOv3相当。除支持LingBot-Depth 2.0之外,LingBot-Vision作为通用基础模型,还能适配多种下游任务。
商业落地:与奥比中光联合认证与产品集成
在商业化应用方面,LingBot-Depth 2.0已通过机器人与AI视觉领域领先厂商奥比中光旗下深度视觉实验室的专业认证。基于奥比中光Gemini 330系列立体3D相机的芯片级深度数据进行的实际测试显示,该模型在边缘清晰度、物体轮廓完整性、小目标识别、远距离深度估计以及复杂光线和材质条件下的鲁棒性等方面均有显著提升。
此外,在奥比中光新发布的机器人无接触数据采集硬件平台产品矩阵中,RGB-D EGO设备将集成专为数据采集优化的定制版LingBot-Depth模型,未来还将进一步引入高级商业版本,持续优化深度补全、物体边缘及空间结构表现,为具身AI训练提供精准、稳定、高可用的真实世界数据基础。
Robbyant与奥比中光还将联合推出集成LingBot-Depth 2.0的新产品,包括:
SDK产品:支持机器人客户在边缘侧进行部署,大幅提升搭载Gemini 330系列相机的系统深度感知能力。
一体化相机:计划于年底前发布,以一体化方案实现"3D相机+空间感知"的整合交付。
开源与生态建设
Robbyant已开源LingBot-Vision的模型权重,并持续致力于与行业伙伴共同构建机器人视觉基础,攻克现实物理世界中"看得到、看得准、看得稳"的关键瓶颈,加速具身智能的商业化落地进程。
Q&A
Q1:LingBot-Depth 2.0相比上一代有哪些提升?
A:LingBot-Depth 2.0在训练数据和性能上均有大幅提升,使用1.5亿样本训练,在16项深度补全基准测试中有12项排名领先。在室内大范围深度缺失场景中,深度误差比前代降低了一半,RMSE从0.132降至0.062。同时,对玻璃、镜面、透明物体等传统深度相机难以处理的场景,表现也更加出色。
Q2:LingBot-Vision有什么特别之处?
A:LingBot-Vision是业内首个以"边界结构"作为预训练目标的视觉基础模型,具备亚像素级边界定位和空间结构理解能力。其预训练数据仅1.6亿张图像,规模比DINOv3小一个数量级,却能达到相近精度。该模型共有ViT-G/L/B/S四个版本,除支持LingBot-Depth 2.0外,还可适配多种下游任务,且模型权重已开源。
Q3:LingBot-Depth 2.0与奥比中光的合作具体包括哪些内容?
A:奥比中光深度视觉实验室对LingBot-Depth 2.0进行了专业认证,并基于Gemini 330系列相机完成了实际测试。双方将联合推出两款新产品:一是支持边缘侧部署的SDK产品,面向搭载Gemini 330系列相机的机器人客户;二是计划年底前发布的一体化相机,集成"3D相机+空间感知"功能。此外,奥比中光新发布的数据采集硬件平台也将集成定制版LingBot-Depth模型。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。