Amazon.com Inc. 今日推出了一款名为 Nova Act 的全新人工智能代理,该代理能够控制网页浏览器并自主执行操作。
这款新的 AI 代理是由 Amazon 新成立的 Amazon AGI 旧金山实验室开发的研究预览版本。该实验室此前在 12 月发布了 Amazon Nova 基础模型。Amazon Nova 最初推出了三个文本生成模型 —— Micro、Lite 和 Pro,具备文本摘要、问答和理解上下文的能力。公司同时还发布了两个能够根据文本和图像输入生成图像和视频的模型,分别名为 Canvas 和 Reel。
公司表示还将通过推出新网站 nova.amazon.com 来扩大 Amazon Nova 的访问范围,开发者和技术爱好者可以在这里探索这些基础模型。
Amazon 人工通用智能高级副总裁 Rohit Prasad 表示:"我们将 Amazon 的前沿智能技术赋予每一位开发者和技术爱好者,让他们能够前所未有地轻松探索 Amazon Nova 的能力。"
Amazon Act 能够代表用户在网页浏览器中完成基本任务,如点击按钮和在输入框中输入文本。随着 AI 代理的发布,Amazon 还扩展了 Nova Act 软件开发工具包 (SDK) 的访问权限。开发者可以利用该工具包构建能够将复杂指令分解为一系列动作的代理,比如"帮我找到从家出发依次访问这三家商店,然后在晚上 6 点左右看电影的最简单路线。"
Amazon 表示,他们希望教会 AI 代理"对用户界面元素具有与人类相同的直觉"。这意味着以与人类相同的方式与网页交互,能够理解图标、表单、网页元素等一切内容,在提出问题或任务时做出类似人类的反应。
在其他大型企业如 Google LLC、OpenAI 和 Anthropic PBC 都在开发日益强大的代理型 AI 解决方案的背景下,Amazon 做出了这一举措。Anthropic 在 10 月推出了其 AI 模型 Claude 的实验版本,该版本可以使用计算机界面,包括网页浏览器。而 Google 在 12 月透露正在测试其旗舰 AI 模型 Gemini 的浏览器控制功能。
Prasad 补充道:"我们创造这种体验是为了激发建设者的灵感,让他们能够使用 Nova 模型快速测试想法,然后在 Amazon Bedrock 中大规模实施。"
Amazon Bedrock 是一项完全托管的 Amazon Web Service Inc. 服务,提供来自公司及其他供应商的云托管前沿 AI 模型访问权限和构建 AI 应用程序的工具。开发者现在可以在 nova.amazon.com 注册下载 Nova Act SDK 或测试各种 Nova 模型。
好文章,需要你的鼓励
北京大学研究团队开发出基于RRAM芯片的高精度模拟矩阵计算系统,通过将低精度模拟运算与迭代优化结合,突破了模拟计算的精度瓶颈。该系统在大规模MIMO通信测试中仅需2-3次迭代就达到数字处理器性能,吞吐量和能效分别提升10倍和3-5倍,为后摩尔时代计算架构提供了新方向。
普拉大学研究团队开发的BPMN助手系统利用大语言模型技术,通过创新的JSON中间表示方法,实现了自然语言到标准BPMN流程图的自动转换。该系统不仅在生成速度上比传统XML方法快一倍,在流程编辑成功率上也有显著提升,为降低业务流程建模的技术门槛提供了有效解决方案。
谷歌宣布已将约3万个生产软件包移植到Arm架构,计划全面转换以便在自研Axion芯片和x86处理器上运行工作负载。YouTube、Gmail和BigQuery等服务已在x86和Axion Arm CPU上运行。谷歌开发了名为CogniPort的AI工具协助迁移,成功率约30%。公司声称Axion服务器相比x86实例具有65%的性价比优势和60%的能效提升。
北京大学联合团队发布开源统一视频模型UniVid,首次实现AI同时理解和生成视频。该模型采用创新的温度模态对齐技术和金字塔反思机制,在权威测试中超越现有最佳系统,视频生成质量提升2.2%,问答准确率分别提升1.0%和3.3%。这项突破为视频AI应用开辟新前景。