データ変換の使用方法
データ変換とは、データ前処理を意味します。これは、予測モデルを作成してデータを調査する前の重要なステップの 1 つです。
データ代入
データ代入は、分類、回帰、クラスタリングなどの予測モデリング・タスクに適しています。これらのタスクでは、欠損値を無視できません。無視すると、結果に問題が生じます。さらに、欠損値を処理するための高度な内部手法は、使用不可であることがよくあり、大規模なデータ・セットに対しては時間がかかりすぎます。
多くの統計分析方式では、欠損値を含むデータは除外されます。これに対し、データ代入では、欠損値を推定値に置き換えることによって、このデータをすべて使用できます。 推定値は、使用可能な他の情報に基づいています。欠損値が置換されると、データ・セットが完全であるかのように、標準的な方式を使用してデータ・セットを分析できます。
データ分割
データ分割は、分類モデルまたは回帰モデルの予測品質を作成およびテストする場合に役立ちます。データは、トレーニング・データ・セットとテスト・データ・セットに分割されます。その後、一方のデータ・セットを使用して予測モデルをトレーニングし、もう一方のデータ・セットを使用して予測モデルをテストします。
例えば、クライアントに関する人口統計情報を含む大規模なデータ・セットがあるとします。異なる市区町村のクライアントごとにモデルを作成するために、入力データを市区町村列の値によって分割します。
標準化および正規化
標準化および正規化は、データ前処理の段階で使用されます。この段階では、後でデータ・マイニングおよび機械学習で処理できるようにデータが準備されます。どちらの方式でも、目的の分布プロパティーを達成するために、連続型属性を変更してデータ・セットの大きさが調整されます。
これらの変換では、元の連続型属性 a を使用して新しい連続型属性 a ' が生成されます。この新しい連続型属性の範囲または分布は、元の属性のものとは異なります。一般的な変換では、範囲が [− 1、1] のインターバルに収まるように変更される (正規化) か、平均値 0、標準偏差 1 になるように分布が変更されます (この場合は標準化とも呼ばれます)。