谷歌DeepMind于周二发布了一款名为Gemini Robotics On-Device的新型语言模型,该模型可在机器人上本地执行任务,无需互联网连接。
基于该公司今年3月发布的Gemini Robotics模型,Gemini Robotics On-Device能够控制机器人的运动。开发者可以使用自然语言提示来控制和微调模型,以满足各种需求。
在基准测试中,谷歌声称该模型的性能接近基于云端的Gemini Robotics模型。公司表示,在通用基准测试中,它优于其他设备端模型,尽管没有具体说明这些模型的名称。
在演示中,该公司展示了运行这一本地模型的机器人执行解拉链包和折叠衣物等任务。谷歌表示,虽然该模型最初是为ALOHA机器人训练的,但后来适配到双臂Franka FR3机器人和Apptronik公司的Apollo人形机器人上。
谷歌声称双臂Franka FR3成功应对了之前从未"见过"的场景和物体,比如在工业传送带上进行装配作业。
谷歌DeepMind还发布了Gemini Robotics SDK。公司表示,开发者可以向机器人展示50到100次任务演示,在MuJoCo物理模拟器上使用这些模型训练机器人执行新任务。
其他AI模型开发者也在涉足机器人领域。英伟达正在构建一个为人形机器人创建基础模型的平台;Hugging Face不仅在开发开源机器人模型和数据集,还在研发机器人;韩国创业公司RLWRLD获得未来资产投资,正致力于创建机器人基础模型。
好文章,需要你的鼓励
苏州大学研究团队提出"语境降噪训练"新方法,通过"综合梯度分数"识别长文本中的关键信息,在训练时强化重要内容、抑制干扰噪音。该技术让80亿参数的开源模型在长文本任务上达到GPT-4o水平,训练效率比传统方法高出40多倍。研究解决了AI处理长文档时容易被无关信息干扰的核心问题,为文档分析、法律研究等应用提供重要突破。
在Cloudera的“价值观”中,企业智能化的根基可以被概括为两个字:“源”与“治”——让数据有源,智能可治。
清华大学团队首次揭示了困扰AI训练领域超过两年的"幽灵故障"根本原因:Flash Attention在BF16精度下训练时会因数字舍入偏差与低秩矩阵结构的交互作用导致训练崩溃。研究团队通过深入分析发现问题源于注意力权重为1时的系统性舍入误差累积,并提出了动态最大值调整的解决方案,成功稳定了训练过程。这项研究不仅解决了实际工程问题,更为分析类似数值稳定性挑战提供了重要方法论。