Databricks 今天启动了"代理周"活动,推出了新的和增强的产品,旨在帮助企业更有信心地部署和扩展人工智能代理。
AI 代理是能够感知环境、做出决策并采取行动以实现特定目标的自主或半自主程序,可以有人类监督也可以完全自主。尽管大多数企业现在都在使用 AI,但由于担心无法追踪或控制代理的行为,许多企业不愿在关键业务或面向客户的场景中部署代理。
Databricks 表示,为了应对这一问题,该公司扩展了其 Mosaic AI Gateway 的功能。这个网关可以帮助企业管理和治理他们的 AI 模型和部署,现在可以支持广泛的开源和商业大语言模型。该软件目前处于公开预览阶段。
目前处于公开预览阶段的 AI/BI Genie Conversation API 套件,使开发者能够将自然语言聊天机器人嵌入到定制应用程序或流行的生产力工具中,如 Microsoft 的 Teams 和 Sharepoint 以及 Salesforce 的 Slack。
Databricks 的 AI 副总裁 Naveen Rao 表示:"人们非常喜欢 Genie 界面,因此他们要求能够将其嵌入到自己的应用程序中。这是一种特殊的代理,允许您在商业智能环境中与数据进行交互。"
Rao 表示,该功能面向需要运行复杂查询但不精通结构化查询语言的商业用户。该代理可以嵌入到任何能够接收应用程序编程接口的应用程序中。他说:"只要设置好权限,您就可以为任何类型的应用程序添加界面。您甚至可以制作在浏览器中运行的 JavaScript 应用程序。"
Genie 无需训练,因为它可以处理表格中已有的元数据,如列标题。例如,它能理解标记为"成本"的列可能指的是金钱,并会在财务查询中包含这些数据。
目前处于公开预览阶段的升级版 Agent Evaluation Review App 让领域专家能够更轻松地提供有针对性的反馈、发送用于标记的追踪信息,并自定义评估标准。
Rao 说:"评估定制模型是客户的一大痛点。构建评估相当困难。您需要有足够的覆盖范围来涵盖所有案例,并且需要足够的深度来充分探测系统。"
他表示,虽然 Graduate-Level Google-Proof Q&A 和 Natural Language Understanding Evaluation REST API Reference 等公共评估框架很有用,但并不总能为特定用例提供所需的深度。Rao 说:"我们让以问答形式定义评估变得非常简单,同时还可以描述任务本身。"
今天同样进入公开预览的还有 Provision-Less Batch Inference,这是一种使用单个 SQL 查询通过 Mosaic AI 运行批量推理的新方法。Rao 表示,它消除了用户配置基础设施的需求,这个功能在对大型数据集进行查询时特别有用。
他说:"对 1000 万行的查询需要比对 5 行的查询更多的基础设施。这个功能会自动计算请求的大小,启动所有必要的计算资源,并以批处理模式运行请求以最小化成本。您完全不需要考虑配置或扩展问题。"
今天的公告是 Databricks 计划在本周内发布的多个代理相关介绍中的第一个。
好文章,需要你的鼓励
三星与AI搜索引擎Perplexity合作,将其应用引入智能电视。2025年三星电视用户可立即使用,2024和2023年款设备将通过系统更新获得支持。用户可通过打字或语音提问,Perplexity还为用户提供12个月免费Pro订阅。尽管面临版权争议,这一合作仍引发关注。
浙江大学团队提出动态专家搜索方法,让AI能根据不同问题灵活调整内部专家配置。该方法在数学、编程等任务上显著提升推理准确率,且不增加计算成本。研究发现不同类型问题偏爱不同专家配置,为AI推理优化开辟新路径。
苹果M5 MacBook Pro评测显示这是一次相对较小的升级。最大变化是M5芯片,CPU性能比M4提升约9%,多核性能比M4 MacBook Air快19%,GPU性能提升37%。功耗可能有所增加但电池续航保持24小时。评测者认为该产品不适合M4用户升级,但对使用older型号用户仍是强有力选择。
清华大学研究团队提出SIRI方法,通过"压缩-扩张"交替训练策略,成功解决了大型推理模型"话多且准确率低"的问题。实验显示,该方法在数学竞赛题上将模型准确率提升43.2%的同时,输出长度减少46.9%,真正实现了效率与性能的双重优化,为AI模型训练提供了新思路。