数据转换背景
数据转换包括通过标准化和正态化进行数据插补、数据拆分和转换。
数据插补
许多分析算法要求数据集不缺失属性值。但是,现实世界的数据集通常会缺失属性值。为了处理缺失值,数据插补是最常用的一种方法。
数据插补将缺失值替换为合理猜测的可用值,以便您可以运行算法,而不必考虑缺失的属性值。例如,合理猜测的可用值对于离散属性来说是众数(最频繁值),对于连续属性来说是均值或中位数。
您也可采用其他方法,但存在限制。
例如,这些方法包括:
- 忽略
- 跳过一个或多个属性有缺失值的实例。
- 陪域扩展
- 将缺失值视为添加到属性陪域的额外值。
- 内部处理
- 内部缺失值由特定于算法的技术进行处理。
数据拆分
在将存储过程用于分类或回归之前,您可能希望将这个表拆分为下列不相交的数据集:
- 一个数据集用于训练预测模型
- 一个数据集用于测试预测模型
标准化和正态化
标准化和正态化是数据预处理方法。它们应用于数字属性,以使这些属性具有类似的均值和标准差。