データ変換の背景
データ変換は、データ代入、データ分割、および標準化と正規化を介した変換で構成されます。
データ代入
多くの分析アルゴリズムでは、データ・セットの属性値が欠落していないことが必要です。 しかし、実際のデータ・セットでは、属性値が欠落していることがよくあります。欠損値を処理するための最も一般的な方法の 1 つがデータ代入です。
データ代入では、属性値の欠落があってもアルゴリズムを実行できるように、欠損値が、正しく推測された使用可能な値に置き換えられます。正しく推測された使用可能な値は、例えば、離散型属性の場合はモード (最も頻度の高い値)、連続型属性の場合は平均値または中央値です。
他の方法もありますが、それには制限があります。
例えば、以下のような方法があります。
- 無視
- 1 つ以上の属性の欠損値があるインスタンスはスキップされます。
- 余域拡張
- missing は、属性の余域に追加される余分な値と見なされます。
- 内部処理
- 内部欠損値は、アルゴリズム固有の手法によって処理されます。
データ分割
分類または回帰のためのストアード・プロシージャーを使用する前に、この表を以下の非結合データ・セットに分割できます。
- 予測モデルをトレーニングするためのデータ・セット
- 予測モデルをテストするためのデータ・セット
標準化および正規化
標準化および正規化は、データ前処理の方法です。これらは、類似の平均値と標準偏差を持つように数値属性に適用されます。