数据转换背景

数据转换包括通过标准化和正态化进行数据插补、数据拆分和转换。

数据插补

许多分析算法要求数据集不缺失属性值。但是,现实世界的数据集通常会缺失属性值。为了处理缺失值,数据插补是最常用的一种方法。

数据插补将缺失值替换为合理猜测的可用值,以便您可以运行算法,而不必考虑缺失的属性值。例如,合理猜测的可用值对于离散属性来说是众数(最频繁值),对于连续属性来说是均值或中位数。

您也可采用其他方法,但存在限制。

例如,这些方法包括:

忽略
跳过一个或多个属性有缺失值的实例。
当数据集中很大比例的实例包含缺失值时,忽略方法并不可行。即使缺失值数量非常少,它们也可能会对分析结果的质量产生负面影响。
陪域扩展
缺失值视为添加到属性陪域的额外值。
陪域扩展仅适用于离散属性,对于此类属性,可将缺失项或使用的任何其他项视为实际值。对于预测建模算法,如果用于创建模型的训练集中的缺失值分布与应用该模型的数据集中的缺失值分布相当,这种方法可能会产生良好的结果。
内部处理
内部缺失值由特定于算法的技术进行处理。
这种方法可能会产生很好的结果,但通常会大大增加计算复杂度。

数据拆分

在将存储过程用于分类或回归之前,您可能希望将这个表拆分为下列不相交的数据集:

  • 一个数据集用于训练预测模型
  • 一个数据集用于测试预测模型

标准化和正态化

标准化和正态化是数据预处理方法。它们应用于数字属性,以使这些属性具有类似的均值和标准差。