Databricks 今天启动了"代理周"活动,推出了新的和增强的产品,旨在帮助企业更有信心地部署和扩展人工智能代理。
AI 代理是能够感知环境、做出决策并采取行动以实现特定目标的自主或半自主程序,可以有人类监督也可以完全自主。尽管大多数企业现在都在使用 AI,但由于担心无法追踪或控制代理的行为,许多企业不愿在关键业务或面向客户的场景中部署代理。
Databricks 表示,为了应对这一问题,该公司扩展了其 Mosaic AI Gateway 的功能。这个网关可以帮助企业管理和治理他们的 AI 模型和部署,现在可以支持广泛的开源和商业大语言模型。该软件目前处于公开预览阶段。
目前处于公开预览阶段的 AI/BI Genie Conversation API 套件,使开发者能够将自然语言聊天机器人嵌入到定制应用程序或流行的生产力工具中,如 Microsoft 的 Teams 和 Sharepoint 以及 Salesforce 的 Slack。
Databricks 的 AI 副总裁 Naveen Rao 表示:"人们非常喜欢 Genie 界面,因此他们要求能够将其嵌入到自己的应用程序中。这是一种特殊的代理,允许您在商业智能环境中与数据进行交互。"
Rao 表示,该功能面向需要运行复杂查询但不精通结构化查询语言的商业用户。该代理可以嵌入到任何能够接收应用程序编程接口的应用程序中。他说:"只要设置好权限,您就可以为任何类型的应用程序添加界面。您甚至可以制作在浏览器中运行的 JavaScript 应用程序。"
Genie 无需训练,因为它可以处理表格中已有的元数据,如列标题。例如,它能理解标记为"成本"的列可能指的是金钱,并会在财务查询中包含这些数据。
目前处于公开预览阶段的升级版 Agent Evaluation Review App 让领域专家能够更轻松地提供有针对性的反馈、发送用于标记的追踪信息,并自定义评估标准。
Rao 说:"评估定制模型是客户的一大痛点。构建评估相当困难。您需要有足够的覆盖范围来涵盖所有案例,并且需要足够的深度来充分探测系统。"
他表示,虽然 Graduate-Level Google-Proof Q&A 和 Natural Language Understanding Evaluation REST API Reference 等公共评估框架很有用,但并不总能为特定用例提供所需的深度。Rao 说:"我们让以问答形式定义评估变得非常简单,同时还可以描述任务本身。"
今天同样进入公开预览的还有 Provision-Less Batch Inference,这是一种使用单个 SQL 查询通过 Mosaic AI 运行批量推理的新方法。Rao 表示,它消除了用户配置基础设施的需求,这个功能在对大型数据集进行查询时特别有用。
他说:"对 1000 万行的查询需要比对 5 行的查询更多的基础设施。这个功能会自动计算请求的大小,启动所有必要的计算资源,并以批处理模式运行请求以最小化成本。您完全不需要考虑配置或扩展问题。"
今天的公告是 Databricks 计划在本周内发布的多个代理相关介绍中的第一个。
好文章,需要你的鼓励
Docker公司通过增强的compose框架和新基础设施工具,将自己定位为AI智能体开发的核心编排平台。该平台在compose规范中新增"models"元素,允许开发者在同一YAML文件中定义AI智能体、大语言模型和工具。支持LangGraph、CrewAI等多个AI框架,提供Docker Offload服务访问NVIDIA L4 GPU,并与谷歌云、微软Azure建立合作。通过MCP网关提供企业级安全隔离,解决了企业AI项目从概念验证到生产部署的断层问题。
中科院联合字节跳动开发全新AI评测基准TreeBench,揭示当前最先进模型在复杂视觉推理上的重大缺陷。即使OpenAI o3也仅获得54.87%分数。研究团队同时提出TreeVGR训练方法,通过要求AI同时给出答案和精确定位,实现真正可追溯的视觉推理,为构建更透明可信的AI系统开辟新路径。
马斯克的AI女友"Ani"引爆全球,腾讯RLVER框架突破情感理解边界:AI下半场竞争核心已转向对人性的精准把握。当技术学会共情,虚拟陪伴不再停留于脚本应答,而是通过"心与心的循环"真正理解人类孤独——这背后是强化学习算法与思考模式的化学反应,让AI从解决问题转向拥抱情感。
PyVision是上海AI实验室开发的革命性视觉推理框架,让AI系统能够根据具体问题动态创造Python工具,而非依赖预设工具集。通过多轮交互机制,PyVision在多项基准测试中实现显著性能提升,其中在符号视觉任务上提升达31.1%。该框架展现了从"工具使用者"到"工具创造者"的AI能力跃迁,为通用人工智能的发展开辟了新路径。