Databricks 今天启动了"代理周"活动,推出了新的和增强的产品,旨在帮助企业更有信心地部署和扩展人工智能代理。
AI 代理是能够感知环境、做出决策并采取行动以实现特定目标的自主或半自主程序,可以有人类监督也可以完全自主。尽管大多数企业现在都在使用 AI,但由于担心无法追踪或控制代理的行为,许多企业不愿在关键业务或面向客户的场景中部署代理。
Databricks 表示,为了应对这一问题,该公司扩展了其 Mosaic AI Gateway 的功能。这个网关可以帮助企业管理和治理他们的 AI 模型和部署,现在可以支持广泛的开源和商业大语言模型。该软件目前处于公开预览阶段。
目前处于公开预览阶段的 AI/BI Genie Conversation API 套件,使开发者能够将自然语言聊天机器人嵌入到定制应用程序或流行的生产力工具中,如 Microsoft 的 Teams 和 Sharepoint 以及 Salesforce 的 Slack。
Databricks 的 AI 副总裁 Naveen Rao 表示:"人们非常喜欢 Genie 界面,因此他们要求能够将其嵌入到自己的应用程序中。这是一种特殊的代理,允许您在商业智能环境中与数据进行交互。"
Rao 表示,该功能面向需要运行复杂查询但不精通结构化查询语言的商业用户。该代理可以嵌入到任何能够接收应用程序编程接口的应用程序中。他说:"只要设置好权限,您就可以为任何类型的应用程序添加界面。您甚至可以制作在浏览器中运行的 JavaScript 应用程序。"
Genie 无需训练,因为它可以处理表格中已有的元数据,如列标题。例如,它能理解标记为"成本"的列可能指的是金钱,并会在财务查询中包含这些数据。
目前处于公开预览阶段的升级版 Agent Evaluation Review App 让领域专家能够更轻松地提供有针对性的反馈、发送用于标记的追踪信息,并自定义评估标准。
Rao 说:"评估定制模型是客户的一大痛点。构建评估相当困难。您需要有足够的覆盖范围来涵盖所有案例,并且需要足够的深度来充分探测系统。"
他表示,虽然 Graduate-Level Google-Proof Q&A 和 Natural Language Understanding Evaluation REST API Reference 等公共评估框架很有用,但并不总能为特定用例提供所需的深度。Rao 说:"我们让以问答形式定义评估变得非常简单,同时还可以描述任务本身。"
今天同样进入公开预览的还有 Provision-Less Batch Inference,这是一种使用单个 SQL 查询通过 Mosaic AI 运行批量推理的新方法。Rao 表示,它消除了用户配置基础设施的需求,这个功能在对大型数据集进行查询时特别有用。
他说:"对 1000 万行的查询需要比对 5 行的查询更多的基础设施。这个功能会自动计算请求的大小,启动所有必要的计算资源,并以批处理模式运行请求以最小化成本。您完全不需要考虑配置或扩展问题。"
今天的公告是 Databricks 计划在本周内发布的多个代理相关介绍中的第一个。
好文章,需要你的鼓励
穆拉蒂时隔18个月首次接受重大媒体采访,介绍其创立的Thinking Machines Lab正在开发的"交互模型"。该模型能以200毫秒间隔处理音频、文本和视频流,捕捉人类交流中的中断、修正和停顿。她还谈及OpenAI"政变周"经历,强调行业决策权过于集中的担忧,并回应了公司近期研究人员离职问题,表示这是初创实验室的正常波动。
STATE16研究院这篇综述发现,物理AI系统存在"静默失效"风险——AI以高度自信执行基于错误世界信息的动作,却不触发任何报警,并提出在AI输出与物理执行之间建立独立授权层的框架。
本期《Quick Charge》播客涵盖多个热点话题:特斯拉疑似试图删除FSD欺诈相关证据以规避巨额赔付;卡特彼勒持续推进建筑领域电气化布局;住宅太阳能30%税收抵免即将到期。此外,嘉宾Tom Pacheco就高压系统与电池技术培训展开探讨,强调电动车技术人才培养的紧迫性。节目同时提醒有意安装太阳能的用户尽快行动,可通过EnergySage平台比较多家安装商报价。
UIUC与微软联合研发的OpenWebRL框架让4B小模型仅凭400条初始数据,通过在真实网站上边做边学的强化学习方式,在网页智能体基准上超越了用27万条数据训练的竞争对手。