为何 AI 数据质量是 AI 成功的关键

AI 数据质量定义

人工智能 (AI) 数据质量,是指数据在人工智能全生命周期(包括训练、验证和部署)中所具备的准确性、完整性、可靠性与适用程度。

在 AI 系统中,数据质量还包含在传统数据质量维度中不那么受重视的因素——例如代表性、偏差、标注准确率以及无关波动(噪声)——这些因素均会影响模型表现。

数据质量在 AI 领域的重要性再怎么强调也不为过:低劣的数据质量是导致 AI 项目失败的最常见原因之一。无论模型架构多么先进,基于存在缺陷、带有偏见或不完整数据训练的 AI 模型,都将产生不可靠的输出结果。俗话说:垃圾进,垃圾出。

另一方面,高质量数据是实现可信且有效 AI 的基础。随着 AI 系统变得更加复杂且可扩展性更强,持续且稳健的数据质量管理,将决定这些系统能否可靠运行、适应环境变化并支撑明智决策。

通过将持续监控和验证直接嵌入到数据和模型管道中,高级数据质量工具可以帮助简化 AI 数据质量管理。除基于规则的自动化外,AI 还可用于提升 AI 数据质量,例如检测细微异常、根据对下游模型的影响程度优先处理问题等。通过自动化核查数据的准确性、一致性、完整性及其他数据质量维度,这类工具可帮助团队及早发现问题,并在 AI 系统迭代升级过程中持续保障数据质量符合要求。

AI 的好坏取决于其数据

全球各地的组织仍在对 AI 领域进行大力投入。Gartner 表示,预计 2026 年全球 AI 支出将超过 2 万亿美元,同比增长 37%。1然而,这种快速扩张掩盖了一个事实,即许多 AI 项目都难以提供持久的价值。

IBM 商业价值研究院 2025 年首席执行官调研显示,仅有 16% 的 AI 项目成功在企业内部规模化推广;2而麻省理工学院的 NANDA 研究3指出,高达 95% 的生成式 AI 试点项目均停留在实验阶段,未能进一步推进。

研究表明,AI 数据质量与数据治理是 AI 生态体系中的核心差异化因素。IBM 商业价值研究院的另一项研究发现,68% 以 AI 为核心的组织表示已拥有成熟完善的数据与治理框架,而其他企业中这一比例仅为 32%。4

正如该研究作者所指出的:“虽然结构化、可获取、高质量的数据基础,不如前沿算法或极具前景的应用场景那般引人注目,但它却是实现 AI 持续成功的必要前提。”

这一基础之所以至关重要,是因为机器学习模型——作为众多 AI 系统的核心组成部分——会直接从所输入的数据集中进行“学习”。当数据因错误、缺失、信息过时、数据孤岛或系统性偏差而无法真实反映现实情况时,模型不仅会继承这些缺陷,还可能大规模放大数据中存在的问题。

例如,在生成式 AI 系统中,比如用于自然语言处理大型语言模型 (LLM)数据质量问题可能会表现为文本内容存在事实错误,或生成带有偏见的图像结果。数据质量差还会导致性能参差不齐,尤其是在不常见输入和代表性不足等极端情况下。

即使是占比很小的低质量数据,也可能产生极大的影响。只需少量糟糕的输出结果,就可能破坏决策效果以及人们对这项技术的整体信任,导致管理者认定某个 AI 工具存在缺陷,而其根本原因其实是支撑该工具的数据质量不佳。

除技术层面的后果外,AI 数据质量低下还会带来法律与伦理层面的影响,包括与数据隐私负责任的数据使用相关的风险。在管理不善的数据上训练的模型,可能会在招聘、信贷、医疗和公共服务等领域加剧歧视现象。与此同时,包括《欧盟人工智能法案》在内的法规,以及美国各州日益增多的人工智能相关法律,都在不断要求企业对数据隐私、训练数据的质量、代表性与来源承担相应责任。

AI 数据质量与传统数据质量有何不同?

衡量 AI 数据质量,所依据的许多维度与通过传统数据质量指标所监测的维度是相同的。区别在于数据质量维度在 AI 场景下的重新定义:评估这些维度时,会考量其对模型训练、模型泛化能力、公平性以及运营风险的影响——尤其是在模型于不同数据环境中开发和部署的过程中。

应用于 AI 系统时,数据质量会通过以下经过调整的数据质量维度进行评估:

  • 数据准确性
  • 完整性
  • 数据完整性
  • 一致性
  • 及时性
  • 相关性

数据准确性

在传统场景中,准确性关注的是数据值是否正确反映了现实世界中的实体或事件,通常通过基础校验与预设阈值来进行验证。在 AI 系统中,准确性还取决于强大的数据验证过程,该过程评估标签噪声(错误或模糊标记的训练样本)、测量误差和代理变量如何影响模型训练。

完整性

在完整性方面,除了检查必填字段或记录是否缺失外,对于 AI 数据质量,这一维度还延伸至数据是否充分覆盖了模型预期会遇到的全部场景类型,包括边界情况、罕见事件以及少数群体相关场景。覆盖范围的不足会导致模型变得脆弱——这类模型整体表现尚可,但在数据代表性不足的场景中就会失效,进而加剧公平性风险与运营风险。

数据完整性

传统意义上,数据完整性旨在确保数据遵循基本规则,例如符合正确的数据模式规范,并在不同系统间实现准确关联。对于 AI 而言,数据完整性还意味着精准掌握数据来源,并能够在整个数据管道中复现数据的处理与使用全过程。

团队应能够追溯数据至其原始来源,并对数据所经历的每一次修改留存清晰记录。重要的数据资产(包括训练数据和模型输入)应受到保护,以便能够发现并排查意外损坏、重复复制或未经授权的修改等问题。

AI Academy

数据管理是生成式 AI 的秘诀吗?

深入了解为什么高质量数据对于成功使用生成式 AI 至关重要。

一致性

除了一致的格式和定义之外,衡量 AI 数据质量还意味着要检查历史数据和新数据是否以一致的方式收集、处理和增强。这类核查有助于确保数据流程或数据源的变更,不会在无意间引发数据失真、偏见或下游模型风险。

时效性

传统意义上的时效性,关注的是数据在采集时点的新鲜程度。在 AI 系统中,时效性还需要监控新数据或实时数据与训练数据有何不同,因为数据或概念漂移会降低模型性能。

相关性

在 AI 应用场景中评估数据相关性,并非判断数据是否大体有用或与问题领域相关,而是要确定每一项特征和样本是否能为系统的预期功能提供有效信息支撑。该指标包括核查数据是否能提升预测性能、支撑模型在不同场景下的鲁棒性、降低对噪声或虚假关联的敏感度,以及助力下游的可解释或诊断工作。

如何获得优质 AI 数据

衡量 AI 数据质量只是建立了一个初始基准,而要维持这一质量,则需要随着数据、使用模式和运行环境的变化,开展持续的数据质量监控。提升和维持 AI 数据质量的四项基础实践包括:

  • 在生命周期早期开展数据剖析与探索
  • 数据可观察性作为基础
  • 使用 AI 进行数据质量检查
  • 通过修复和反馈形成闭环
在生命周期早期开展数据剖析与探索

数据剖析有助于团队了解底层数据源、数据的采集方式、结构与转换过程,以及数据如何通过数据沿袭在流程中流转。该过程包括识别异常值、检查缺失值,以及分析结构化数据与非结构化数据(如文本或图像)之间的关联关系。

这些做法为模型训练奠定了精准可靠的数据基础。这些工作应在模型开发之前开展,并嵌入到早期的数据准备流程中,同时利用原始数据及相关的元数据

数据可观察性作为基础

数据可观测性提供了实现大规模生产工作流中有效持续监控和检查所需的可见性。通过对数据流程进行监控,可观测性能够帮助团队实时掌握数据随时间的变化情况,追溯数据质量问题的根源,并将数据变动与下游模型效果关联分析。

随着 AI 系统在复杂度、数据量和可扩展性上不断提升,这种端到端的可视性对于维持数据质量至关重要。

使用 AI 进行数据质量检查

AI 本身也可用于提升输入模型的数据的质量、可靠性与管理水平。具备内置自动化能力与 AI 智能体的 AI 驱动型数据质量解决方案,能够在新的大规模复杂数据集流经数据流程时,对其持续进行数据剖析。

此外,它们还可执行异常检测,识别数据不一致、超出合理范围的数值以及分布偏移问题,并通过去重处理发现并消除重复记录及相关的数据质量问题。

通过修复和反馈形成闭环

维持 AI 数据质量,还需要建立将监控信号与实际行动关联起来的反馈闭环。来自数据质量监控与可观测性的分析结果,可为整改措施提供依据,例如重新训练模型、更新标注规范、调整预处理逻辑,或在数据代表性不足的领域补充采集数据。

随着时间推移,这种持续反馈能够让团队在 AI 系统不断迭代的过程中,同时优化其数据质量管控措施与模型性能。

作者

Alexandra Jonker

Staff Editor

IBM Think

Judith Aquino

Staff Writer

IBM Think

相机、音量旋钮和剪贴板等图标排成螺旋状的 3D 渲染图
相关解决方案
IBM StreamSets

通过直观的图形界面创建和管理智能流数据管道,促进跨混合和多云环境的无缝数据集成。

深入了解流媒体集
IBM watsonx.data™

watsonx.data 支持您通过开放、混合和已治理数据,利用您的所有数据(无论位于何处)扩展分析和 AI。

了解 watsonx.data
数据和分析咨询服务

借助 IBM Consulting 释放企业数据的价值,构建一个可带来业务优势的洞察驱动型组织。

了解分析服务
采取下一步行动

设计数据战略,消除数据孤岛、降低复杂性并提高数据质量,以获得卓越的客户和员工体验。

  1. 深入了解数据管理解决方案
  2. 了解 watsonx.data
脚注

1 Gartner 表示,2025 年全球 AI 支出总额将达到 1.5 万亿美元 Gartner,2025 年 9 月 17 日5
2 2025 CEO Study: 5 mindshifts to supercharge business growth,IBM 商业价值研究院,2025 年 7 月 9 日
3 The GenAI Divide: State of AI in Business 2025,MIT NANDA,2025 年 7 月
4 From AI projects to profits: How agentic AI can sustain financial returns,IMB 商业价值研究院,2025 年 6 月 12 日