Databricks推出LTAP架构,合并企业两类数据库

Databricks在旧金山Data + AI峰会上发布湖泊事务/分析处理架构(LTAP),旨在消除企业事务型与分析型数据库之间的长期割裂。该架构基于此前收购的Neon和Mooncake Labs构建,将两类数据统一存储于开放格式的云对象存储中,同时保留独立计算引擎。LTAP支持Git风格数据库分支,专为AI智能体设计。此外,Databricks还发布了实时分析引擎Lakehouse//RT及Unity AI Gateway等新产品。

Databricks希望消除企业运营数据库与分析数据库之间长期存在的鸿沟。在旧金山举行的Data + AI峰会上,该公司发布了一种名为湖仓事务/分析处理(Lake Transactional/Analytical Processing,简称LTAP)的新架构,旨在为智能体的应用场景彻底打通这道壁垒。

Databricks早在此前就已着手布局,并通过2025年相继收购无服务器Postgres初创公司Neon和Mooncake Labs,将这一方向落到实处。其核心判断是:智能体而非人类,将成为企业数据栈的主要用户,因此底层基础设施必须围绕智能体重新构建。

Databricks联合创始人兼CEO Ali Ghodsi在发布声明中表示:"数十年来,复杂的数据基础设施是企业团队被迫承担的额外负担。而随着智能体的到来,短短数月间,企业的'劳动力'实际上翻了一番,只不过新增的不是人类员工。智能体能以人类团队望尘莫及的速度编写代码、发起调用、执行循环。曾经支撑上一个计算时代的基础设施,如今已成为所有人都无法承受的瓶颈。LTAP正是为了消除这一障碍而生。"

Ghodsi在峰会主题演讲中称LTAP是"行业耕耘40年的重大突破,我们认为我们终于做到了"。

长期以来,企业不得不同时运行两类数据库:联机事务处理(OLTP)系统以行存格式处理订单、支付、库存等业务实时操作,追求快速写入;联机分析处理(OLAP)系统则以列存格式对相同数据进行报表分析,专注于大规模扫描效率。两者因性能和可靠性原因而相互隔离,企业通常依赖ETL管道和数据副本来桥接它们。

Databricks认为,智能体需要一套截然不同的系统——能够同时读取实时事务数据、基于历史上下文进行推理,并在两者之上并发执行操作。

该公司指出,此前合并两层数据库的尝试均未能成功:混合事务与分析处理(HTAP)系统成本高昂且存在供应商锁定风险,而"零ETL"工具本质上仍是隐式的变更数据捕获,数据仍存在两份副本,数据陈旧问题依然存在。

LTAP将事务数据与分析数据统一存储在单一存储层,采用开放格式存储于云对象存储上,统一治理,同时为不同类型的计算任务保留独立的计算引擎。

该架构直接基于Lakebase构建。Lakebase是Databricks于2025年6月推出的基于Postgres的操作型数据库,被该公司定位为一种"新型类别"产品,通过将计算与存储分离,以开放格式将数据存入湖仓。

此次,Databricks进一步扩展了Lakebase的能力,面向关键业务工作负载新增了原生向量搜索与全文检索、通过Lakeflow Connect摄取服务旗下的Zerobus实现实时事件摄取,以及类Git分支机制——允许智能体复制一份数据库进行实验后随时丢弃。

Ghodsi表示:"智能体喜欢随时分叉并在数据上做实验,尝试不同方案,而且要求速度够快,不愿意等上十分钟才能启动一个数据库。"

架构的第二部分是Lakehouse//RT,这是一款实时分析引擎,由Databricks自研的向量化引擎Reyden驱动,可直接在湖仓的Delta和Iceberg表上运行。

长期以来,企业为获得毫秒级查询速度,不得不另行搭建专用系统,将数据复制到湖仓旁边的"服务层"。Databricks表示,Lakehouse//RT消除了这一额外层次,无需额外数据副本、管道或治理缺口,即可在湖仓数据上实现毫秒级延迟响应。

Databricks着重强调了该引擎的高并发能力。PointClickCare工程高级副总裁Mehrshad Setayesh表示,Lakehouse//RT"在医疗数据集上的平均速度比我们原有数据仓库快了三分之一以上,特定查询提速高达10倍",并且让该公司摆脱了在湖仓之外另行维护专用实时系统的需求。

LTAP的核心价值主张在于:数据只需以开放格式存储一份,无需复杂的数据管道。Databricks去年在介绍Lakebase架构时写道,该架构在事务与分析工作负载之间共享同一存储层,"无需移动或复制数据"。

Lakebase的分析性能得益于Databricks收购的初创公司Mooncake。Mooncake能将Postgres的变更实时镜像到湖仓,这也是事务与分析能够基于同一份最新数据运行的核心机制。Databricks在宣布收购时写道:"Postgres的变更会被实时镜像到湖仓。"镜像过程会生成一份列存格式的副本,正是这一副本让分析查询得以高速运行。

该公司同时表示,安全、治理、审计和高可用能力"只需在单一开放基础上实现和管理一次即可"。

分支功能则是专为智能体场景而设计的核心特性,也是Neon的核心能力之一。由于数据存储在对象存储上,智能体可以像操作Git分支一样,随时fork一个完整数据库、对其进行测试,再将其丢弃。Databricks表示,即使是PB级别的数据库也能在数秒内完成复制,而传统数据库启动一个新实例往往需要数分钟乃至数小时,克隆生产环境更可能带来中断风险。

正如Ghodsi在主题演讲中所指出的,智能体天然偏爱Postgres,但也需要更好的工具与之配合,甚至需要更好的数据库本身。他表示:"未来12个月,我们将见证人类历史上规模最大的软件创作浪潮。你们的组织借助大语言模型和编程工具构建的所有这些软件,背后都需要数据库的支撑。"

LTAP只是本次长达三小时主题演讲的一部分。与众多企业级厂商一样,Databricks也在思考如何管控智能体无序扩张及其带来的成本问题。Databricks给出的答案是Unity AI Gateway——一个统一的控制点,覆盖组织内运行的所有模型、智能体、MCP服务器和技能。该产品提供支出仪表盘、按团队或用户设置的预算、速率限制以及跨MCP服务器的单点登录等功能。

此外,Databricks还发布了面向业务团队的通用智能体Genie One,其背后由Genie Ontology提供支撑——后者是一个新的数据语义层,通过名为OntoRank的类PageRank算法,为企业数据构建带权重的图谱。

Ghodsi还重点介绍了OpenSharing,这是一项用于跨平台共享数据、模型和智能体技能的新协议(其前身Delta Sharing现已成为Linux基金会旗下的开源项目)。

Databricks还发布了面向营销团队的客户数据平台CustomerLake,并宣布收购基于Python的安全公司Panther,以强化其安全信息与事件管理服务Lakewatch。

在数据层面,以及深厚的数据科学背景,才是Databricks真正能够建立差异化竞争力的地方。当前几乎每家企业软件厂商,无论其核心专长为何,都在争相推出智能体构建、编排和治理工具。Databricks在这一领域能够扮演相对中立的角色——Ghodsi在主题演讲后的媒体发布会上也特别强调了这一点。

但该公司同样清醒地意识到,其他企业SaaS厂商可以凭借领域专长和存量客户数据为智能体构筑护城河,而Databricks更多扮演的是基础设施层的角色。正因如此,此次推出CustomerLake这类面向特定行业的产品也就不难理解——它在客户已存储于平台上的数据基础上,叠加了一层现成的产品能力,进一步向应用层延伸。

Q&A

Q1:LTAP架构是什么?它要解决什么问题?

A:LTAP(湖仓事务/分析处理)是Databricks发布的新型数据架构,旨在消除企业长期并行维护事务数据库(OLTP)与分析数据库(OLAP)的现状。传统上两类系统因性能和可靠性原因相互隔离,需要ETL管道桥接。LTAP将两类数据统一存储在单一存储层,以开放格式保存于云对象存储,同时保留各自独立的计算引擎,使智能体能同时读取实时事务数据和历史分析数据。

Q2:Lakebase和Lakehouse//RT分别是什么?

A:Lakebase是Databricks于2025年6月推出的基于Postgres的操作型数据库,将计算与存储分离,数据以开放格式存入湖仓,支持向量搜索、全文检索、实时事件摄取以及类Git分支机制,专为智能体工作负载设计。Lakehouse//RT则是一款实时分析引擎,由自研的向量化引擎Reyden驱动,可直接在Delta和Iceberg表上实现毫秒级查询延迟,无需额外数据副本或专用实时系统。

Q3:Databricks此次峰会还发布了哪些产品?

A:除LTAP架构外,Databricks还发布了Unity AI Gateway(统一管控组织内所有模型和智能体的控制平面,支持预算管理、速率限制和单点登录)、面向业务团队的通用智能体Genie One、数据共享协议OpenSharing、面向营销团队的客户数据平台CustomerLake,并宣布收购Python安全公司Panther以强化旗下安全服务Lakewatch。

来源:The New Stack

0赞

好文章,需要你的鼓励

2026

07/13

09:26

分享

点赞

邮件订阅