评估合成数据

合成数据的有效性取决于其质量,这就需要开发和利用适当的评价指标。 在这方面,合成数据指标在评估生成的数据的保真度,多样性和效用方面起着至关重要的作用。

在数据科学和机器学习领域,高质量数据的可用性对于构建准确而稳健的模型至关重要。 但是,在许多现实场景中,由于隐私问题,数据稀缺或昂贵的数据获取流程等各种限制,获取足够和多样化的数据可能是一项具有挑战性的任务。 为了应对这些挑战,合成数据生成的概念获得了牵引力,提供了一个充满希望的解决方案,可以用人工生成的数据来扩充或取代现实世界的数据。

Synthetic Data Generator 使用质量,隐私和实用程序度量值来帮助您评估合成数据。

如何评估合成数据

要评估合成数据,可以在 导入 节点与 生成 节点之间连接 Evaluate 节点。 如何连接以评估合成数据

您还可以在两个 导入 节点之间或两个 生成 节点之间连接 Evaluate 节点。

连接 Evaluate 节点后,单击 编辑 按钮。 如何编辑 Evaluate 节点

评估节点选项

以下子主题说明如何选择用于评估合成数据的选项。

重要: 合成数据中可能会出现重复记录。 您可以选择 "删除重复记录 "选项,如果重复记录超过数据集的 5%,该选项将删除重复记录,只保留首次出现的记录。
重要信息: 如果未正确连接节点,那么将收到以下错误: 需要基线输入

质量指标

保真度分数

汇总多个指标,反映真实数据和合成数据中各列分布的相似性,以及所有列对相关性的相似性。

数据可区分性

反映二元分类器将真实数据与合成数据区分开来的能力。 训练此类分类器的难度越大,合成数据的质量相对于其反映真实数据的统计属性的能力就越好。

隐私指标

泄漏分数

测量合成数据中与实际数据中的某些行相同的行部分。

近似分数

根据合成数据中的点与真实数据之间的距离计算得出。 这个距离越小,就越容易将一些行与真实数据隔离开来,这就增加了隐私风险。

效用指标

预测效用

衡量合成数据对下游预测任务的有用性。 它评估从合成数据中训练的预测模型的性能,以使用真实数据作为测试数据来准确预测所选目标。

评估级别

简单评估

在简单评估模式下,指标在一个单一的 ML(机器学习)模型上运行。

全面评估

在完全评估方式下,将尽可能针对多个 ML (机器学习) 模型对度量进行评估和平均。