辅以专家洞察分析的最新科技新闻
通过 Think 时事通讯,了解有关 AI、自动化、数据等方面最重要且最有趣的行业趋势。请参阅 IBM 隐私声明。
和数据湖一样,湖仓一体采用低成本的云对象存储。该方式支持存储几乎所有格式的数据(结构化、半结构化、非结构化)。
其湖仓一体的核心,是在存储层之上搭建的数据仓库风格数据管理层,该层补充数据结构与治理能力,支撑分析和 BI 工作负载。
多数湖仓一体会采用开放表格式 (OTF),主要包括:
这类技术充当元数据层,将开放式数据文件(例如 Apache Parquet 格式文件)整理为类数据库的逻辑表。
这种方法允许组织像使用数据仓库结构化数据一样处理数据湖原始数据,同时支持时间回溯、版本管理、架构演进、数据操作以及事务一致性 (ACID) 等核心功能。
(“ACID”代表原子性、一致性、隔离性和持久性。这些特性用于保障数据事务的完整性与可靠性。)
依托新增的层级与功能,湖仓一体让数据湖的使用更稳定、更便捷。用户还可以直接在数据湖运行结构化查询语言 (SQL)、分析任务以及各类高级用例,简化 BI、AI、ML 和数据智能 (DI) 相关工作。
通过 Think 时事通讯,了解有关 AI、自动化、数据等方面最重要且最有趣的行业趋势。请参阅 IBM 隐私声明。
湖仓一体的架构通常由五层组成:
存储层依托低成本云对象存储,存放结构化、非结构化以及半结构化数据集。常见的服务包括 Amazon Simple Storage Service (Amazon S3)、Microsoft Azure Blob Storage、Google Cloud Storage 和 IBM Cloud Object Storage。
数据通常采用适配大型分析工作负载的列式存储格式,例如 Apache Parquet 或优化行列式 (ORC)。该层级体现出湖仓一体的一大优势,即以高性价比承载几乎所有类型的数据。
分层数据架构 (MDA) 是一套分层式、以数据质量为核心的设计方案,确保湖仓一体数据从摄取到使用的全流程中,逐步完成清洗与校验,保障数据可信。该方案可帮助组织搭建具备扩展性、规范管理的湖仓一体,兼顾日常业务报表、深度分析以及机器学习工作负载。
在数据量不断增长的过程中,这类扩展能力是维持数据质量的关键。根据 2025 年 1 月的一项基准调研,数据量超过 7 PB 后,87.4% 的组织表示旧版数据质量框架已无法稳定运行。2
该框架将数据在全生命周期内划分为青铜、白银、黄金三个层级,逐层提升数据质量。
黄金层还可提升数据对 AI 的适配能力。该层级直接向 ML 管道输送高质量的适配 AI 就绪数据流,有助于提升模型精度,减少数据准备工作量。
这套分层数据处理流程,可基于最终数据文件逆向追溯全部转换过程,还原原始数据。同时运维成本更可控且整体开销更低,可结合各层级的用途优化数据存储与计算资源。
湖仓一体具备多项核心特性:
Apache Parquet、ORC 等开放式列式存储格式,借助高效压缩、列裁剪与谓词下推技术,提升查询性能并降低存储成本。这类格式兼容主流分析引擎,支持组织内多方同时读取同一批数据。该特性可规避供应商锁定问题,实现各类工具之间的互操作性。
多数湖仓一体采用 Apache Iceberg、Apache Hudi、Delta Lake 等开放表格式,实现了 ACID 事务能力。插入、更新、删除等事务操作,可确保数据在处理过程及处理完成后保持一致、稳定。
湖仓一体依托低成本云对象存储,在海量数据与大规模工作负载场景下,相比传统数据仓库更具成本优势。湖仓一体的混合架构无需维护多套存储系统,通常能够缩减各项开支。
湖仓一体采用存储与计算分离架构,数据团队可对二者分别进行扩容。这种解耦设计也带来灵活性,可使用不同计算引擎或节点支撑各类应用,同时读取同一份数据。
湖仓一体并非数据仓库与数据湖的简单叠加。它是一套融合两者优势的统一架构,集成在同一个平台中。
数据仓库面向结构化数据分析场景设计。通过存储和转换企业数据,为商业智能应用与报表输出提供出色性能。
但是,数据仓库不具备数据湖的灵活性。随着数据量与工作负载不断增加,其运行效率与使用成本会逐渐显现短板。数据仓库采用严格的模式约束,这意味着数据存入存储库前必须匹配预设模型,也就是写入时确定模式。由于这些限制,他们难以处理非结构化和半结构化数据,而这类数据对于 AI 和 ML 相关用例至关重要。
湖仓一体旨在解决数据仓库与数据湖的各类问题,将两者优势整合至同一平台。它们采用灵活且低成本的存储方案,兼容各类数据类型,同时具备完善的数据管理与高性能处理能力,在一套架构内支撑 BI、数据分析以及 AI/ML 工作负载。
IBM Software 首席产品经理 Anson Kokkat 阐述了湖仓一体对于现代 AI 项目的重要意义:
“AI 模型的表现,取决于底层具备完善管理能力与扩展性的数据平台。合适的湖仓一体,是将企业原始数据转化为可落地商用 AI 能力的基础。基于开放架构搭建的湖仓一体,能赋予 AI 应用高度灵活性,您无需绑定单一引擎,还可对接 Presto、Apache Spark、OpenSearch、Cassandra 等现有开源工具。”
另一大优势在于,组织可在保留现有数据湖与数据仓库的基础上部署湖仓一体,无需彻底拆除重构。
目前已有众多服务商推出开放式湖仓一体产品。该架构支持开放数据与开放格式,可使用 Parquet、Avro、Apache ORC 等不依赖特定厂商的格式存储海量数据。也可借助 Apache Iceberg 开放表格式实现海量数据共享。
湖仓一体落地过程中常见挑战包括:部署流程复杂,含现有数据平台迁移工作;在统一数据访问的前提下兼顾数据治理与安全;以及在数据量持续增长时,始终维持最优查询性能。
可以。湖仓一体依托完善的数据治理能力,实现海量多元数据的统一访问,以此支撑 AI 和 ML 工作负载。它们采用开放数据与开放表格式,以避免供应商锁定,同时实现存储层与 ML 框架的直接对接。
想要避免形成数据沼泽,就需要建立完善的数据治理、数据质量与数据安全机制。此外,分层 (medallion) 存储架构可梳理数据体系,搭载 ACID 事务能力的开放表格式,能够保障数据完整、一致且稳定。
通过直观的图形界面创建和管理智能流数据管道,促进跨混合和多云环境的无缝数据集成。
watsonx.data 支持您通过开放、混合和已治理数据,利用您的所有数据(无论位于何处)扩展分析和 AI。
借助 IBM Consulting 释放企业数据的价值,构建一个可带来业务优势的洞察驱动型组织。
1 Data Lakehouse Architecture: The Evolution of Enterprise Data Management,Journal of Computer Science and Technology Studies,2025 年 6 月 23 日。
2 Data Lakehouse Implementation: A Journey From Traditional Data Warehouses,World Journal of Advanced Engineering Technology and Sciences,2025 年 2 月 26 日。
3 Data Lakehouse: A Survey and Experimental Study,Science Direct,2024 年 9 月 26 日。
4 Minimizing Incident Response Time in Real-World Scenarios Using Quantum Computing,Springer Nature Link,2023 年 5 月 26 日。