資料轉換的背景

資料轉換包含透過標準化及正規化的資料插補、資料分割和轉換。

資料插補

許多分析演算法均要求資料集不得有遺漏的屬性值。 不過,實際資料集往往有遺漏的屬性值。若要處理遺漏值,資料插補是最常見的其中一種方法。

資料插補是將遺漏值取代為合理猜測的可用值,因此即使您遺漏屬性值,仍可執行演算法。例如,這些是合理猜測的可用值:適用於離散屬性的模式(最常見的值),或適用於連續屬性的平均值或中位數。

還有其他可用的方法,但它們有所限制。

例如,這類方法如下:

忽略
跳過具有一個以上屬性之遺漏值的實例。
當具有遺漏值的實例包含資料集的很大部分時,忽略方法並不實際。即使遺漏值的數目只有一點點,也可能會對分析結果的品質產生負面影響。
對應域 (Codomain) 延伸
missing 視為額外值而新增至屬性的對應域。
對應域延伸僅適用於離散屬性,針對其所使用的 missing 項目或其他任何項目可被視為實際值。如果在適用於模型建立的訓練集內,其遺漏值的分佈與套用該模型的資料集內的分佈類似,則此方法可能會在預測建模演算法中產生良好結果。
內部處理
內部遺漏值是由演算法特有的技術來處理。
這種方法可能產生較好的結果,但通常會增加很大的計算複雜性。

資料分割

在使用儲存程序進行分類或迴歸之前,您可能想要將此表格分割成下列沒有關聯的資料集:

  • 一個用來訓練預測模型的資料集
  • 一個用來測試預測模型的資料集

標準化與正規化

標準化與正規化是資料前處理的方法。它們套用至數值屬性,因此會有類似的平均值和標準差。