现实世界始终处于运动之中。为了实现自主运行,物理AI系统——包括机器人、自动驾驶汽车和智能空间——不仅需要理解它们所看到的内容以及导致这些现象发生的原因,还需要预测接下来可能发生什么。
在仓库中,机器人可能会遇到从未见过的物体配置。在道路上,自动驾驶汽车可能需要在行人从停放的车辆之间走出时做出反应。而在工厂里,安全系统必须预测叉车的行进方向,而不仅仅是检测到它的存在。
在现实世界中捕捉和重现这些场景既缓慢又昂贵,而且往往无法大规模重复。
NVIDIA Cosmos 3正是为此而生。这款全新的世界基础模型在今天于台北COMPUTEX举办的NVIDIA GTC大会上发布,它将视觉推理和多模态生成能力整合在单一模型中,涵盖文本、视频、图像、环境声音和动作,帮助开发者创建具有物理上下文的世界数据。
Q&A
Q1:NVIDIA Cosmos 3是什么?
A:NVIDIA Cosmos 3是一款世界基础模型,它将视觉推理和多模态生成能力整合在单一模型中,能够处理文本、视频、图像、环境声音和动作等多种模态,帮助开发者为物理AI系统创建具有物理上下文的世界数据。
Q2:物理AI系统为什么需要预测能力?
A:物理AI系统如机器人、自动驾驶汽车和智能空间需要在现实世界中自主运行。它们不仅要理解当前看到的内容和原因,还需要预测接下来可能发生的情况,以便做出正确的决策和反应,比如应对突然出现的行人或预测叉车的行进方向。
Q3:为什么在现实世界中训练物理AI系统很困难?
A:在现实世界中捕捉和重现训练场景既缓慢又昂贵,而且往往无法大规模重复。比如仓库中的特殊物体配置或道路上的突发情况,这些场景难以在真实环境中反复创建用于训练。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。