資料轉換的用法

資料轉換表示資料前處理。這是您在建立預測模型及檢查資料之前的重要步驟。

資料插補

資料插補適用於預測建模作業,例如分類、迴歸及叢集作業。對於這些作業,如果忽略遺漏值一定會對結果造成問題。此外,處理遺漏值的已調整內部技術往往無法使用,或對大型資料集而言太耗時。

許多統計分析方法會排除含有遺漏值的資料。資料插補則相反,它以預估值取代遺漏值,因此能夠使用完整資料。 預估值是以其他可用資訊為基礎。取代遺漏值時,您可以使用標準方法來分析資料集,就好像這是完整的資料集。

資料分割

資料分割對於建置及測試分類模型或迴歸模型的預測品質非常有用。資料將分割成訓練資料集及測試資料集。您因此可以使用一個資料集來訓練預測模型,使用另一個資料集來測試預測模型。

例如,假設您有一個包含關於客戶人口統計資訊的大型資料集。因為您要為不同城市的客戶建立不同的模型,所以您可以依城市直欄的值來分割輸入資料。

標準化與正規化

標準化與正規化用於資料前處理的階段。在這個階段,會準備資料以進行後續在資料探勘及機器學習上的處理。這兩種方法都透過修改連續屬性來調整資料集,以達到所需的分佈內容。

對於這些轉換,會使用原始連續屬性 a 來產生新的連續屬性 a '。這個新的連續屬性有不同於原始屬性的範圍或分佈。一般轉換會修改此範圍以符合 [1,1] 間隔(正規化),或者,它們會修改分佈,讓平均值為 0,標準差為 1,在這種情況下也稱為標準化。