データ変換の背景

データ変換は、データ代入、データ分割、および標準化と正規化を介した変換で構成されます。

データ代入

多くの分析アルゴリズムでは、データ・セットの属性値が欠落していないことが必要です。 しかし、実際のデータ・セットでは、属性値が欠落していることがよくあります。欠損値を処理するための最も一般的な方法の 1 つがデータ代入です。

データ代入では、属性値の欠落があってもアルゴリズムを実行できるように、欠損値が、正しく推測された使用可能な値に置き換えられます。正しく推測された使用可能な値は、例えば、離散型属性の場合はモード (最も頻度の高い値)、連続型属性の場合は平均値または中央値です。

他の方法もありますが、それには制限があります。

例えば、以下のような方法があります。

無視
1 つ以上の属性の欠損値があるインスタンスはスキップされます。
欠損値があるインスタンスがデータ・セットの大部分を構成している場合、無視の方法は実用的ではありません。欠損値の数が最小限であっても、分析結果の品質に悪影響を与える可能性があります。
余域拡張
missing は、属性の余域に追加される余分な値と見なされます。
余域拡張は離散型属性にのみ適用可能です。離散型属性では、missing (あるいは使用される他の任意の用語) を実際の値と見なすことができます。モデル作成用のトレーニング・セットにおける欠損値の分布が、モデルが適用されるデータ・セットにおける分布と同等である場合、この方法により予測モデリング・アルゴリズムで良い結果を得られる可能性があります。
内部処理
内部欠損値は、アルゴリズム固有の手法によって処理されます。
この方法は、より優れた結果を生成する可能性がありますが、通常はそれだけ計算が複雑になります。

データ分割

分類または回帰のためのストアード・プロシージャーを使用する前に、この表を以下の非結合データ・セットに分割できます。

  • 予測モデルをトレーニングするためのデータ・セット
  • 予測モデルをテストするためのデータ・セット

標準化および正規化

標準化および正規化は、データ前処理の方法です。これらは、類似の平均値と標準偏差を持つように数値属性に適用されます。