什么是数据丰富?

作者

Alice Gomstyn

Staff Writer

IBM Think

Alexandra Jonker

Staff Editor

IBM Think

什么是数据丰富?

数据丰富是一种借助内外部补充信息完善数据集,以此提升数据质量与可用性的技术。

 

如今组织收集的数据量远超以往,但这类数据往往缺少背景信息与实际含义。数据丰富有助于填补这些信息缺失,加深对现有数据点的理解,无论是原始数据还是数据集。以这种方式增强数据,可以让晦涩的数据集变得具备参考价值,赋能组织做出更明智的决策。

数据丰富工作通常涵盖在企业数据管理主数据管理计划内。组织会结合自身业务需求与数据源,开展多种类型的数据丰富工作,例如人口统计、企业统计和地理位置丰富。数据团队可以手动进行数据丰富,而人工智能 (AI) 和自动化技术则能够进一步优化相关流程。

数据丰富的常见用例集中在营销战略领域,其流程同样可应用于网络安全、医疗保健、城市规划等场景。实践表明,数据丰富对提升机器学习模型表现的作用日渐凸显,它可补充背景信息、完善数据内容,进而提升预测结果的准确度。

数据丰富的重要性

试想一幅仅完成局部绘制的画布,画面下半部分是以蓝色笔触勾勒的海洋,画面中央还分布着几处亮眼的金色色块。待到整幅画作完成就能看出,这些色块实则是光影反射,作品描绘出了水面日落的景象。

未完成的画布本身也具备艺术价值,但它仍有进一步完善的空间。经过数据丰富优化后的数据集,也是同样的道理。

例如,仅记录姓名和电话号码的客户数据表,在补充电子邮件地址后,就能成为实用性更强的外联工具。为街道地址数据集补充地理坐标后,便可挖掘出社区土地利用方面的深度洞察分析。

随着企业持续生成、收集海量原始数据与非结构化数据,数据丰富工作也变得愈发紧迫。原始数据与非结构化数据体量越大,数据集中的信息空缺和背景缺失问题也就越突出。借助数据丰富,组织可将现有数据与其他数据点相关联,赋予数据实际价值,进而提升数据资产的投资回报率。

数据丰富的优势

数据丰富可以带来多项优势,具体如下:

  • 提高数据准确性数据丰富可以填补现有数据中的各类空缺,比如邮寄地址不全、专业头衔缺失等问题。
 
  • 提高信任度:从不同维度查看数据,例如为企业名称数据集补充行业分类代码,能让使用者确认所调取的数据符合自身使用需求。
 
  • 优化 AI 性能:人工智能(包括机器学习生成式 AI 模型),在输入高质量、完整数据时才能发挥最佳功能。
 
  • 决策洞察分析:通过数据丰富得到的综合数据集,能够帮助企业挖掘市场需求、定价等领域的全新规律与机遇。例如,结合客户相关洞察分析,可依据客户偏好开展精准营销工作。
 
AI Academy

数据管理是生成式 AI 的秘诀吗?

深入了解为什么高质量数据对于成功使用生成式 AI 至关重要。

数据丰富与数据增强的区别

“数据丰富”和“数据增强”两个术语常被混用,但二者属于不同的处理流程。尽管两者都可以提升数据质量,但数据增强侧重处理现有数据,而数据丰富的核心是为数据集添加全新的数据点。

在数据增强流程中,数据清理与数据更新是两大核心工作。为补齐字段缺失值、更新过时信息,数据增强过程中也会少量新增数据,但新增数据的规模远不及数据丰富。

开展数据丰富工作时,通常会为现有数据集增设新字段。和数据增强一样,数据清理也是该流程的一环,主要用于为后续新增信息做好准备。(参见下文“数据丰富的关键步骤”。)

数据丰富的类型

组织通常会选用以下一种或多种数据丰富方式,为现有数据集补充相关信息:

  • 行为数据丰富:记录客户行为,以及客户使用产品、服务和各类沟通渠道(包括移动应用程序、社交媒体账号)的互动情况的数据。
 
  • 联系数据丰富:用于完善联系人清单的各类信息,包括电话号码、电子邮件地址、商业关联和社交媒体资料。
 
  • 人口统计丰富:涵盖年龄、性别、族裔、婚姻状况、收入等人物特征。也称为社会人口统计丰富。
 
  • 企业统计丰富:记录企业相关详情,例如所属行业、规模、收入和所在地。
 
  • 地理丰富:记录主体所在地的相关信息,如街道地址、邮政编码、国家和地理坐标。
 
  • 心理特征丰富:记录个人生活方式、兴趣、态度和观念的数据。
 
  • 技术特征丰富:记录个人或组织所用技术类型的数据,包括应用程序、工具、硬件、软件及 IT 基础设施

数据丰富的关键步骤

不同组织的数据丰富流程存在差异,但整体包含几项通用步骤:

数据清理

运用标准化(统一格式)、数据去重等方式,对待丰富的数据集进行清理。

识别丰富机会

判断需要为数据集补充哪些具备价值的信息。

数据采购

确定新数据的来源,并根据实际情况在内、外部来源中进行选择。

数据集成

使用数据集成软件等工具,将新数据添加至目标数据集。

数据丰富所使用的数据源

组织可依托内部数据开展数据丰富工作,其中包括第一方数据(直接从客户处采集的数据)以及第三方来源数据。

计划使用内部数据源的企业,常会遇到一个问题:数据孤岛。幸运的是,企业可借助数据集成打破数据孤岛,该流程能够汇总各类异构来源的数据,并将其转换为统一、可用的格式。例如,组织可以集成客户关系管理 (CRM) 系统与营销数据库内的数据,以此丰富客户数据集。

企业也可选用外部数据源,主要分为免费公共数据源与第三方数据服务商两类。公共数据源包含政府数据集(例如人口普查数据、就业报告)。第三方数据服务商则采集并售卖各类数据,涵盖联系数据、人口统计数据以及企业统计数据。企业在选用第三方数据时,应仅与可信的渠道及供应商合作,以此保障数据准确、及时,并符合自身质量要求。

在数据丰富流程中采集并存储的所有数据,都需要遵循数据隐私与安全相关法规进行管理,例如 GDPR 以及《健康保险流通和责任法案》 (HIPAA)

数据丰富工具

随着数据驱动决策模式的普及以及 AI 相关数据需求的增长,市场对高质量数据以及数据丰富工具的需求持续攀升。预计到2030年,全球数据丰富解决方案市场规模预计将从 2023 年的约 24 亿美元增长至近 46 亿美元。

AI 的应用不仅推动了数据丰富解决方案的普及,也为多款先进数据丰富工具提供技术支撑。以下列举了常用的数据丰富工具及解决方案类型:

  • 数据集成解决方案:此类方案支持提取、转换和加载 (ETL) 流程,可完成数据丰富、数据清理及其他数据处理工作。(需要注意的是,数据集成解决方案还可以对完成丰富处理的数据进行操作处理,将其加载至数据仓库及其他终端用于分析工作。)
 
  • 开放式数据湖仓一体:领先的数据湖仓解决方案可以自动摄取和丰富非结构化数据,并将其与结构化数据集成统一。
 
 
  • 智能体式丰富工作流解决方案:AI 智能体可以进一步简化数据丰富流程。在一类智能体数据丰富模式中,用户创建电子表格后,会触发应用程序编程接口 (API),从网络中检索并摄取相关实时数据。新信息经由 LLM 处理后,即可录入至电子表格当中。1

数据丰富的用例

数据丰富可应用于众多不同领域与行业。

营销和销售

营销团队与销售团队是数据丰富功能的高频使用者,尤其会用到行为数据丰富、人口统计丰富以及企业统计丰富。团队借助经过丰富处理的数据搭建客户档案、落实客户细分策略、制定定制化营销活动,并为客户提供个性化服务体验。

城市规划

高质量空间数据是城市规划与建设工作的重要基础。地理编码是地理丰富的其中一种形式,它能够根据街道地址换算出经纬度坐标,助力城市规划人员精准定位地点。

医疗保健与生命科学

可穿戴设备、健康健身应用程序以及其他健康监测技术,现已成为丰富患者数据集与研究数据集的全新信息来源。这类数据丰富工作能够协助医护人员优化诊疗服务,也可帮助研究人员挖掘重要规律与洞察分析。

网络安全

结合物理位置(地理丰富)、使用设备(技术特征丰富)等信息对安全事件数据进行丰富,能够提升网络安全风险与漏洞的评估效果。

相机、音量旋钮和剪贴板等图标排成螺旋状的 3D 渲染图
相关解决方案
IBM StreamSets

通过直观的图形界面创建和管理智能流数据管道,促进跨混合和多云环境的无缝数据集成。

深入了解流媒体集
IBM watsonx.data™

watsonx.data 支持您通过开放、混合和已治理数据,利用您的所有数据(无论位于何处)扩展分析和 AI。

了解 watsonx.data
数据和分析咨询服务

借助 IBM Consulting 释放企业数据的价值,构建一个可带来业务优势的洞察驱动型组织。

了解分析服务
采取下一步行动

设计数据战略,消除数据孤岛、降低复杂性并提高数据质量,以获得卓越的客户和员工体验。

  1. 深入了解数据管理解决方案
  2. 了解 watsonx.data