围绕Agent重构数据底座,大厂为啥集中做Lakebase?
从云原生到AI就绪,再到AI原生、Agentic Database……围绕生成式 AI 和自主 Agent构建的数据底座,一直在花样翻新!进入2026年,数据库领域再次出现一个新变化 ,大厂们集中在推Lakebase。那么,问题来了,什么是Lakebase?
什么是Lakebase?
从字面意义理解,Lakebase(湖库一体)是面向AI时代的一种新型数据基础设施架构。它融合了“数据湖”架构的开放性与海量存储能力,以及“数据库”架构的事务一致性与在线服务能力,旨在将结构化、半结构化、非结构化及向量数据纳入统一的治理体系中进行管理、加工、检索和调用。
Lakebase的核心特征包括:
1.存算分离。将数据存放在低成本、高可靠的云对象存储(数据湖)中,计算层则作为独立、弹性的无服务器(Serverless)引擎运行,支持秒级扩缩容甚至缩容至零。
2.多模态统一管理。打破数据孤岛,让文本、图片、音视频、JSON、向量等多种数据形态在同一套元数据、权限和事务体系下被管理,直接支撑在线服务、实时分析和AI应用。
3.AI原生与Agent友好。支持库内推理、模型算子化以及面向AI Agent的实时上下文工程,帮助Agent获取完整业务上下文,并支持数据分支等隔离环境。
从数据库的演进路线来看,大多数都是单体架构,包括 MySQL、Postgres 和经典的 Oracle。Lakebase 基于 Postgres 构建,核心改动是将 Postgres 计算实例变为 无状态,通过将 WAL 日志和本地磁盘上的数据文件外部化到专用的、独立可扩展的服务中来实现这一点。计算层变成了一个无状态的 Postgres 引擎,可以自由启动、停止和复制,因为它不再拥有数据。
谁在主推Lakebase?
目前,国内外多家主流数据库与数据平台厂商都在积极向 Lakebase 架构演进,但各自的切入路径有所不同。首先,Databricks 是这一架构的先锋,演进路径是从Lakehouse向 Lakebase演进的方式。国内主要跟进的是阿里云 PolarDB和OceanBase,主要从数据库方向进行 Lakebase 架构演进。
具体区分如下:
1. Databricks:从湖仓向事务延伸
Databricks 是最早将 Lakebase 作为产品叙事推向台前的厂商。其路线是从湖仓(Lakehouse)出发,向上增强在线事务处理(OLTP)能力。Databricks 推出了基于开放对象存储的无服务器 Postgres 数据库,并将其与 Lakehouse 统一在同一治理模型下,使操作型数据立即可查询、立即可用于分析。
2. 阿里云 PolarDB:云原生的AI数据湖库
阿里云 PolarDB 在2026年初发布了 AI 数据湖库(Lakebase)。其核心思路是将大模型能力内化为数据库的“血液”,推动数据库从“外挂式AI”向“内生智能”演进。PolarDB 通过“湖库一体”架构统一管理全模态数据,并在SQL层深度融合向量与全文检索,提供面向 Agent 应用开发的后端服务。
3. OceanBase:从数据库向外延伸
OceanBase 于2026年中发布了湖库一体 AI 数据库(OceanBase Lakebase)。其路线是从金融级分布式数据库内核出发,向外延伸湖存储能力。OceanBase 强调在同一套引擎中统一管理多模态数据,打通在线与离线处理,并推出了配套的数据治理工作台(DataStudio)和业务智能 Agent(DataPilot),旨在大幅降低企业数据底座的组件拼装复杂度与整体拥有成本(TCO)。
4. 其他厂商的探索
除了上述三家,其他厂商也在基于自身优势探索类似架构。例如,Zilliz 将 Vector Database(向量数据库)与 Data Lake 融合,围绕向量检索和 AI Search 打造了 Vector 版本的 Lakebase 架构。
对比而言,各家厂商虽然对 Lakebase 的理解和切入点不同(有的从湖出发,有的从库出发,有的从向量库出发),但底层趋势高度一致:都在致力于打破技术壁垒,通过“一体化”的融合,让一套系统能够同时管理多模态数据,从而更好地支撑 AI Agent 时代的复杂需求。
Lakebase为什么会流行?
很明显,Lakebase 架构诞生的原动力在于,更好地支撑AI Agent走向生产场景。因为,智能体的负载催生出一种极其独特性的使用模式,那就是第三代数据库的典型特征是:数以百万计、短生命周期且深度分叉(deeply branched)。当数据库像代码分支一样被频繁创建、测试,然后迅速销毁。面对这种苛刻的要求,传统那种笨重的单体式 OLTP 引擎显然已经力不从心。
数据库的破局点在哪里?大厂们给出一个答案:Lakebase 架构。这不仅仅是一个新产品,更是第三代云数据库架构的正式确立。
Lakebase 的核心魔法,在于将 Serverless PostgreSQL 的计算与存储进行了彻底解耦。借助开放格式,它把数据和预写日志(write-ahead log)直接持久化到了云对象存储中。这种设计不仅完美契合了智能体工作流的诉求,还带来了两个极其硬核的底层创新:
首先是亚秒级的冷启动(cold start)。配合 Serverless 架构,Lakebase 能够瞬间拉起计算资源,让海量短生命周期的数据库随需而生。
其次是类 Git 的数据库工作流。通过写时复制(copy-on-write)的分支机制,Lakebase 可以在瞬间克隆出一个隔离的数据库环境。这种高效的分支能力,让开发者(甚至 AI 智能体本身)可以像操作代码一样,安全、低成本地在数据库上进行实验与迭代。
更令人兴奋的是,得益于计算与存储的分离,Lakebase 打破了传统的事务与分析壁垒。它允许我们在实时事务数据上,直接进行低延迟的分析,彻底告别了繁琐的 ETL 数据搬运。
面向未来,Lakebase 正在引领第三代云数据库向最新方向演进。在 AI 智能体重塑开发范式的今天,这或许才是数据底座该有的样子。