离散化与矩

某些数据分析算法需要分类输入数据,而不是数字输入数据。在这种情况下,必须通过将数字值映射到离散值的离散化步骤进行数据预处理。矩是数量,用于描述连续属性分布的某些方面。中心矩(即,围绕均值的矩)的意义尤其重要。

离散化

离散化算法分为下列几个类别:

无监督
不使用目标概念或类属性来设置区间界限。
通常,在不考虑稍后将数据用于分类的情况下执行离散化时,或者可以对同一数据集考虑不同分类任务时,将会应用无监督算法。此处,将各种属性用作目标概念。
受监督
使用目标概念或类属性来设置最合适的区间界限。
在概念上和计算上,比无监督算法更复杂。

矩属于数据探索的任务系列。

数据探索的目的如下所示:

  • 熟悉数据
  • 检测与数据质量相关的可能问题
  • 观察对于后续分析处理可能有用的数据分布
尽管完成数据探索后通常会执行预测建模,但是数据探索本身可能会生成有用的结果。