这让在家构建复杂机器人项目变得更容易。
本周早些时候,AI 开发平台 Hugging Face 发布了一个名为 SmolVLA 的开源机器人 AI 模型。Hugging Face 声称,SmolVLA 基于“兼容许可”的社区共享数据集训练,在虚拟环境和真实世界环境下均超越了许多规模更大的机器人模型。
Hugging Face 在博客文章中写道:“SmolVLA 旨在普及视觉-语言-行为 (VLA) 模型的应用,并加速向通用机器人代理的研究。SmolVLA 不仅是一个轻量但功能强大的模型,更是一种训练和评估通用机器人技术的方法。”
SmolVLA 是 Hugging Face 快速扩展低成本机器人硬件与软件生态系统努力的一部分。去年,该公司推出了 LeRobot,这是一个专注于机器人领域的模型、数据集和工具集合。最近,Hugging Face 收购了法国机器人初创公司 Pollen Robotics,并推出了多款经济实惠的机器人系统,其中包括仿人机器人,可供购买。
SmolVLA 拥有 4.5 亿参数,其训练数据来自 LeRobot Community 数据集,这是在 Hugging Face AI 开发平台上共享的特别标记的机器人数据集。参数,有时被称为“权重”,是指导模型行为的内部组件。
Hugging Face 声称,SmolVLA 足够小,可以在单一家用 GPU 上运行——甚至能够在 MacBook 上运行——并且可以在包括该公司自有机器人系统在内的“经济实惠”硬件上进行测试和部署。
更有趣的是,SmolVLA 还支持“异步推理栈”,Hugging Face 表示这一特性使模型能将机器人动作的处理与所见所听的信息处理分离。正如该公司在博客文章中解释:“由于这种分离,机器人在快速变化的环境中能够更快做出响应。”
Hugging Face 可从其平台下载 SmolVLA。当前,一位用户在 X 平台上声称已使用该模型控制第三方机器人手臂。
值得注意的是,Hugging Face 远非初露锋芒的开源机器人竞赛中唯一的参与者。Nvidia 拥有一系列开源机器人工具,而初创公司 K-Scale Labs 正在构建其所谓的“开源仿人机器人”组件。在该领域内,还有几家实力雄厚的公司,包括 Dyna Robotics、得到杰夫·贝佐斯支持的 Physical Intelligence 以及 RLWRLD。
好文章,需要你的鼓励
谷歌Agent Development Kit(ADK)革新了AI应用开发模式,采用事件驱动的运行时架构,将代理、工具和持久化状态整合为统一应用。ADK以Runner为核心,通过事件循环处理用户请求、模型调用和外部工具执行。执行逻辑层管理LLM调用和工具回调,服务层提供会话、文件存储等持久化能力。这种架构支持多步推理、实时反馈和状态管理,为构建超越简单聊天界面的生产级AI应用提供了完整框架。
上海AI实验室联合团队开发RoboVIP系统,通过视觉身份提示技术解决机器人训练数据稀缺问题。该系统能生成多视角、时间连贯的机器人操作视频,利用夹爪状态信号精确识别交互物体,构建百万级视觉身份数据库。实验显示,RoboVIP显著提升机器人在复杂环境中的操作成功率,为机器人智能化发展提供重要技术突破。
苹果在iOS 26中推出全新游戏应用,为iPhone、iPad和Mac用户提供个性化的游戏中心。该应用包含五个主要版块:主页展示最近游戏和推荐内容,Arcade专区提供超过200款无广告游戏,好友功能显示Game Center动态并支持游戏挑战,资料库可浏览已安装游戏并提供筛选选项,搜索功能支持按类别浏览。iOS 26.2版本还增加了游戏手柄导航支持,为游戏玩家提供更便捷的操作体验。
英伟达研究团队提出GDPO方法,解决AI多目标训练中的"奖励信号坍缩"问题。该方法通过分别评估各技能再综合考量,避免了传统GRPO方法简单相加导致的信息丢失。在工具调用、数学推理、代码编程三大场景测试中,GDPO均显著优于传统方法,准确率提升最高达6.3%,且训练过程更稳定。该技术已开源并支持主流AI框架。