資料轉換的背景
資料轉換包含透過標準化及正規化的資料插補、資料分割和轉換。
資料插補
許多分析演算法均要求資料集不得有遺漏的屬性值。 不過,實際資料集往往有遺漏的屬性值。若要處理遺漏值,資料插補是最常見的其中一種方法。
資料插補是將遺漏值取代為合理猜測的可用值,因此即使您遺漏屬性值,仍可執行演算法。例如,這些是合理猜測的可用值:適用於離散屬性的模式(最常見的值),或適用於連續屬性的平均值或中位數。
還有其他可用的方法,但它們有所限制。
例如,這類方法如下:
- 忽略
- 跳過具有一個以上屬性之遺漏值的實例。
- 對應域 (Codomain) 延伸
- 將 missing 視為額外值而新增至屬性的對應域。
- 內部處理
- 內部遺漏值是由演算法特有的技術來處理。
資料分割
在使用儲存程序進行分類或迴歸之前,您可能想要將此表格分割成下列沒有關聯的資料集:
- 一個用來訓練預測模型的資料集
- 一個用來測試預測模型的資料集
標準化與正規化
標準化與正規化是資料前處理的方法。它們套用至數值屬性,因此會有類似的平均值和標準差。