谷歌DeepMind于周二发布了一款名为Gemini Robotics On-Device的新型语言模型,该模型可在机器人上本地执行任务,无需互联网连接。
基于该公司今年3月发布的Gemini Robotics模型,Gemini Robotics On-Device能够控制机器人的运动。开发者可以使用自然语言提示来控制和微调模型,以满足各种需求。
在基准测试中,谷歌声称该模型的性能接近基于云端的Gemini Robotics模型。公司表示,在通用基准测试中,它优于其他设备端模型,尽管没有具体说明这些模型的名称。
在演示中,该公司展示了运行这一本地模型的机器人执行解拉链包和折叠衣物等任务。谷歌表示,虽然该模型最初是为ALOHA机器人训练的,但后来适配到双臂Franka FR3机器人和Apptronik公司的Apollo人形机器人上。
谷歌声称双臂Franka FR3成功应对了之前从未"见过"的场景和物体,比如在工业传送带上进行装配作业。
谷歌DeepMind还发布了Gemini Robotics SDK。公司表示,开发者可以向机器人展示50到100次任务演示,在MuJoCo物理模拟器上使用这些模型训练机器人执行新任务。
其他AI模型开发者也在涉足机器人领域。英伟达正在构建一个为人形机器人创建基础模型的平台;Hugging Face不仅在开发开源机器人模型和数据集,还在研发机器人;韩国创业公司RLWRLD获得未来资产投资,正致力于创建机器人基础模型。
好文章,需要你的鼓励
Allen AI研究所联合多家顶尖机构推出SAGE智能视频分析系统,首次实现类人化的"任意时长推理"能力。该系统能根据问题复杂程度灵活调整分析策略,配备六种智能工具进行协同分析,在处理10分钟以上视频时准确率提升8.2%。研究团队创建了包含1744个真实娱乐视频问题的SAGE-Bench评估平台,并采用创新的AI生成训练数据方法,为视频AI技术的实际应用开辟了新路径。
联想推出新一代NVMe存储解决方案DE6600系列,包含全闪存DE6600F和混合存储DE6600H两款型号。该系列产品延迟低于100微秒,支持多种连接协议,2U机架可容纳24块NVMe驱动器。容量可从367TB扩展至1.798PiB全闪存或7.741PiB混合配置,适用于AI、高性能计算、实时分析等场景,并配备双活控制器和XClarity统一管理平台。
中科院团队首次系统评估了AI视觉模型在文本压缩环境下的理解能力,发现虽然AI能准确识别压缩图像中的文字,但在理解深层含义、建立关联推理方面表现不佳。研究通过VTCBench测试系统揭示了AI存在"位置偏差"等问题,为视觉文本压缩技术的改进指明方向。