什么是湖仓一体?

什么是湖仓一体?

湖仓一体是一种现代数据平台,融合数据湖低成本的数据存储数据仓库高性能分析及数据管理能力。

以往,组织通常搭配使用数据湖与数据仓库。数据湖统一收纳原始结构化、半结构化与非结构化数据,数据再经由 ETL/ELT 管道流转至数据仓库,支撑商业智能 (BI)、预测性分析等下游用例。

然而,协调两类系统输出可靠数据会耗费大量时间与资源,处理数据分析和 AI 工作负载时尤为明显。数据移动容易造成数据滞后与冗余,多层 ETL/ELT 处理也会带来数据质量一致性方面的隐患。

湖仓一体将数据仓库的数据管理与分析能力直接赋能数据湖内存储的数据,以此改善上述问题。这种架构可帮助数据团队统一数据管理、加快数据处理、提升数据质量,同时承载可扩展的人工智能 (AI) 和机器学习 (ML) 工作负载。

湖仓一体的工作原理是什么?

和数据湖一样,湖仓一体采用低成本的云对象存储。该方式支持存储几乎所有格式的数据(结构化、半结构化、非结构化)。

其湖一体的核心,是在存储层之上搭建的数据仓库风格数据管理层,该层补充数据结构与治理能力,支撑分析和 BI 工作负载。

多数湖仓一体会采用开放表格式 (OTF),主要包括:

  • Apache Hudi(最初由 Uber 研发,适用于增量数据处理)
  • Apache Iceberg(面向海量分析表的高性能格式)
  • Delta Lake(由 Databricks 开发,2019 年开源的主流格式)

这类技术充当元数据层,将开放式数据文件(例如 Apache Parquet 格式文件)整理为类数据库的逻辑表。

这种方法允许组织像使用数据仓库结构化数据一样处理数据湖原始数据,同时支持时间回溯、版本管理、架构演进、数据操作以及事务一致性 (ACID) 等核心功能。

(“ACID”代表原子性、一致性、隔离性和持久性。这些特性用于保障数据事务的完整性与可靠性。)

依托新增的层级与功能,湖仓一体让数据湖的使用更稳定、更便捷。用户还可以直接在数据湖运行结构化查询语言 (SQL)、分析任务以及各类高级用例,简化 BI、AI、ML 和数据智能 (DI) 相关工作。

湖仓一体架构的层级

湖仓一体的架构通常由五层组成:

  • 摄取层
  • 存储层
  • 元数据层
  • API 层
  • 消费层

摄取层

第一层负责从各类内外部数据源采集数据,完成预处理后供存储与分析使用。摄取层可通过连接器对接数据库管理系统NoSQL 数据库SaaS 应用程序、社交媒体信息流等数据源。数据摄取支持批量模式与实时模式。

存储层

存储层依托低成本云对象存储,存放结构化、非结构化以及半结构化数据集。常见的服务包括 Amazon Simple Storage Service (Amazon S3)、Microsoft Azure Blob Storage、Google Cloud Storage 和 IBM Cloud Object Storage

数据通常采用适配大型分析工作负载的列式存储格式,例如 Apache Parquet 或优化行列式 (ORC)。该层级体现出湖仓一体的一大优势,即以高性价比承载几乎所有类型的数据。

元数据层

元数据层是一个统一的目录,用于梳理并展示数据湖内的数据信息。该层级通常依托 Apache Iceberg、Apache Hudi、Delta Lake 等开放表格式实现。

该层级的功能可实现 ACID 事务、时间回溯与架构约束,助力完善数据治理。该层级拥有完善的访问控制机制,对处理敏感数据的组织至关重要,也便于追踪数据访问与变更行为,留存审计记录。1

API 层

应用程序编程接口 (API) 为湖仓一体的数据与元数据提供标准化访问途径。具体而言,该层级支持数据消费者与开发人员借助各类分析引擎、机器学习框架(例如 TensorFlow),直接基于湖仓一体数据开展高级分析模型训练

使用层

湖仓一体架构的最后一层负责托管应用程序和工具,以便访问存储于湖中的所有数据。它面向整个组织的用户开放了数据访问权限,使其能够利用湖仓一体来执行商业智能仪表板、数据可视化和机器学习作业等任务。

什么是分层湖仓一体架构?

分层数据架构 (MDA) 是一套分层式、以数据质量为核心的设计方案,确保湖仓一体数据从摄取到使用的全流程中,逐步完成清洗校验,保障数据可信。该方案可帮助组织搭建具备扩展性、规范管理的湖仓一体,兼顾日常业务报表、深度分析以及机器学习工作负载。

在数据量不断增长的过程中,这类扩展能力是维持数据质量的关键。根据 2025 年 1 月的一项基准调研,数据量超过 7 PB 后,87.4% 的组织表示旧版数据质量框架已无法稳定运行。2

该框架将数据在全生命周期内划分为青铜、白银、黄金三个层级,逐层提升数据质量。

  • 青铜层用于存放原始数据。该层级会完整保留从源系统获取的原始数据。这能保障原始文件始终不可修改,规避数据在转换过程中丢失或被覆盖的风险。

  • 白银层负责对数据进行清洗、结构化处理与丰富。该层级整合冲突或重复的数据记录,形成统一数据源,支撑分析工作与运营报表。

  • 黄金层存放经过加工、可直接投入业务使用的数据,作为单一可信信息源,适用于战略决策。所有核心业务指标均在该层级完成定义与预计算。

黄金层还可提升数据对 AI 的适配能力。该层级直接向 ML 管道输送高质量的适配 AI 就绪数据流,有助于提升模型精度,减少数据准备工作量。

这套分层数据处理流程,可基于最终数据文件逆向追溯全部转换过程,还原原始数据。同时运维成本更可控且整体开销更低,可结合各层级的用途优化数据存储与计算资源。

湖仓一体的关键功能有哪些?

湖仓一体具备多项核心特性:

  • 开放文件格式
  • ACID 事务
  • 统一数据
  • 经济高效存储
  • 灵活工作负载
  • 强大数据治理
  • 可扩展性
  • 实时流媒体支持

开放文件格式

Apache Parquet、ORC 等开放式列式存储格式,借助高效压缩、列裁剪与谓词下推技术,提升查询性能并降低存储成本。这类格式兼容主流分析引擎,支持组织内多方同时读取同一批数据。该特性可规避供应商锁定问题,实现各类工具之间的互操作性

ACID 事务

多数湖仓一体采用 Apache Iceberg、Apache Hudi、Delta Lake 等开放表格式,实现了 ACID 事务能力。插入、更新、删除等事务操作,可确保数据在处理过程及处理完成后保持一致、稳定。

统一数据

单一数据存储体系构建出统一平台,可满足各类业务数据需求,减少不同系统与团队之间的数据孤岛数据冗余。这种统一也大幅减少数据在各类管道和系统间的流转,简化了端到端的数据可观察性

经济高效存储

湖仓一体依托低成本云对象存储,在海量数据与大规模工作负载场景下,相比传统数据仓库更具成本优势。湖仓一体的混合架构无需维护多套存储系统,通常能够缩减各项开支。

灵活工作负载

湖仓一体适用于数据管理生命周期中的不同用例。它们可承载商业智能数据驱动可视化流程,以及机器学习模型训练、实时分析等复杂度更高的数据科学项目——所有这些都基于同一套数据。

完善的数据治理与安全能力

湖仓一体架构借助统一元数据目录、模式约束以及内置数据质量管理工具,改善数据湖存在的治理难题。可通过访问控制、监控审计、数据脱敏、区块链乃至量子计算等技术强化数据安全3,4

可扩展性

湖仓一体采用存储与计算分离架构,数据团队可对二者分别进行扩容。这种解耦设计也带来灵活性,可使用不同计算引擎或节点支撑各类应用,同时读取同一份数据。

实时流式传输支持

现代湖仓一体专为当下的业务和技术需求而构建。许多数据源包含来自物联网设备等来源的实时流数据。湖仓一体系统通过实时数据摄取与增量处理能力,对接这类数据源。

湖仓一体与数据仓库或数据湖有何不同?

湖仓一体并非数据仓库与数据湖的简单叠加。它是一套融合两者优势的统一架构,集成在同一个平台中。

数据仓库:治理能力与性能出色,灵活性偏弱

数据仓库面向结构化数据分析场景设计。通过存储和转换企业数据,为商业智能应用与报表输出提供出色性能。

但是,数据仓库不具备数据湖的灵活性。随着数据量与工作负载不断增加,其运行效率与使用成本会逐渐显现短板。数据仓库采用严格的模式约束,这意味着数据存入存储库前必须匹配预设模型,也就是写入时确定模式。由于这些限制,他们难以处理非结构化和半结构化数据,而这类数据对于 AI 和 ML 相关用例至关重要。

数据湖:灵活性更强,治理与分析能力不足

数据湖允许组织将不同来源的结构化、非结构化、半结构化数据统一存储。它采用读取时确定模式的机制,数据模型在数据使用阶段加载,而非存储阶段。同时,其存储方案扩展性更强、成本更低,一般采用云对象存储。

但是,数据湖没有内置数据处理工具,需要依托外部组件完成分析工作。它们的规模和复杂性可能需要更多技术用户的专业能力,例如数据科学家和数据工程师。此外,由于数据治理发生在下游,因此数据湖很容易出现数据孤岛,进而演变成数据沼泽(因管理不善而难以访问良好数据)。

湖仓一体:兼具数据湖的灵活性与数据仓库的管理能力、运行性能

湖仓一体旨在解决数据仓库与数据湖的各类问题,将两者优势整合至同一平台。它们采用灵活且低成本的存储方案,兼容各类数据类型,同时具备完善的数据管理与高性能处理能力,在一套架构内支撑 BI、数据分析以及 AI/ML 工作负载。

IBM Software 首席产品经理 Anson Kokkat 阐述了湖仓一体对于现代 AI 项目的重要意义:

“AI 模型的表现,取决于底层具备完善管理能力与扩展性的数据平台。合适的湖仓一体,是将企业原始数据转化为可落地商用 AI 能力的基础。基于开放架构搭建的湖仓一体,能赋予 AI 应用高度灵活性,您无需绑定单一引擎,还可对接 Presto、Apache Spark、OpenSearch、Cassandra 等现有开源工具。”

另一大优势在于,组织可在保留现有数据湖与数据仓库的基础上部署湖仓一体,无需彻底拆除重构。

AI Academy

数据管理是生成式 AI 的秘诀吗?

深入了解为什么高质量数据对于成功使用生成式 AI 至关重要。

湖仓一体常见问题解答

什么是开放式湖仓一体?

目前已有众多服务商推出开放式湖仓一体产品。该架构支持开放数据与开放格式,可使用 Parquet、Avro、Apache ORC 等不依赖特定厂商的格式存储海量数据。也可借助 Apache Iceberg 开放表格式实现海量数据共享。

湖仓一体涉及哪些常见问题?

湖仓一体落地过程中常见挑战包括:部署流程复杂,含现有数据平台迁移工作;在统一数据访问的前提下兼顾数据治理与安全;以及在数据量持续增长时,始终维持最优查询性能。

您能否在湖仓一体架构上运行 AI 和机器学习?

可以。湖仓一体依托完善的数据治理能力,实现海量多元数据的统一访问,以此支撑 AI 和 ML 工作负载。它们采用开放数据与开放表格式,以避免供应商锁定,同时实现存储层与 ML 框架的直接对接。

湖仓一体能否完全取代数据仓库?

可以,但具体是否采用,取决于您的数据使用诉求。湖仓一体适合存储多元大数据并承载 AI/ML 工作负载,而数据仓库依旧适用于结构化数据场景,以及对高性能、低延迟有高要求的业务。许多组织会同时使用两类平台。

如何避免湖仓一体演变为“数据沼泽”?

想要避免形成数据沼泽,就需要建立完善的数据治理、数据质量与数据安全机制。此外,分层 (medallion) 存储架构可梳理数据体系,搭载 ACID 事务能力的开放表格式,能够保障数据完整、一致且稳定。

Techsplainers | 播客 | 什么是湖仓一体?

收听:“什么是湖仓一体?”

关注 Techsplainers:SpotifyApple PodcastsCasted

作者

Alexandra Jonker

Staff Editor

IBM Think

Alice Gomstyn

Staff Writer

IBM Think

相机、音量旋钮和剪贴板等图标排成螺旋状的 3D 渲染图
相关解决方案
IBM StreamSets

通过直观的图形界面创建和管理智能流数据管道,促进跨混合和多云环境的无缝数据集成。

深入了解流媒体集
IBM watsonx.data™

watsonx.data 支持您通过开放、混合和已治理数据,利用您的所有数据(无论位于何处)扩展分析和 AI。

了解 watsonx.data
数据和分析咨询服务

借助 IBM Consulting 释放企业数据的价值,构建一个可带来业务优势的洞察驱动型组织。

了解分析服务
采取下一步行动

设计数据战略,消除数据孤岛、降低复杂性并提高数据质量,以获得卓越的客户和员工体验。

  1. 深入了解数据管理解决方案
  2. 了解 watsonx.data
脚注

1 Data Lakehouse Architecture: The Evolution of Enterprise Data Management,Journal of Computer Science and Technology Studies,2025 年 6 月 23 日。

2 Data Lakehouse Implementation: A Journey From Traditional Data Warehouses,World Journal of Advanced Engineering Technology and Sciences,2025 年 2 月 26 日。

3 Data Lakehouse: A Survey and Experimental Study,Science Direct,2024 年 9 月 26 日。

4 Minimizing Incident Response Time in Real-World Scenarios Using Quantum Computing,Springer Nature Link,2023 年 5 月 26 日。