離散化與動差的背景
離散化可以不受監督或受監督。動差是數量,其說明連續屬性分佈的特定層面。
離散化
離散化程序會將離散值指派給連續屬性 a 的每一個間隔,以建立新的離散屬性 a '。離散化演算法決定應盡量保留原始屬性中的有用資訊的間隔界限。如果資料集用於建立分類模型,則資料集離散化應保留類別與離散化屬性之間的關係。
您可以使用下列類型的離散化演算法:
- 等寬離散化
- 對間隔範圍設定使用等寬準則的未受監督離散化演算法。
- 相等頻率離散化
- 對間隔範圍設定使用相等頻率(資料計收)準則的未受監督離散化演算法。
- 最小熵離散化
- 受監督的離散化演算法,它將類別分佈不純度減到最小,以識別最適當的間隔範圍。
動差
其中,中央動差或平均值附近的動差特別重要。
第 k 個中央動差是指屬性值與乘冪數為 k 的屬性平均值之間的差異平均值。
第 2 個中央動差是變異數。此變異數測量分佈的分散程度。
第 3 個中央動差及第 4 個中央動差通常以標準化形式使用。它們會除以標準差的相對應乘冪數,亦即 3 或 4。
第 3 個標準化中央動差也稱為偏斜度。它是一種常見的分佈不對稱測量,以 0 值表示對稱分佈,負值表示較長的左尾,正值表示較長的右尾。
第 4 個標準化中央動差是峰態。它作為分佈尖峰的測量。通常,在峰態計算中,會從第 4 個標準化中央動差扣除常數 3。其結果有時稱為超額峰態。此更正可讓常態分佈的峰態等於 0。如果分佈比常態更平坦,則它是負數,如果分佈比常態更尖,則它是正數。