區別分析

區別元件分析會為群組成員資格建置預測模型。 此模型由區別函數組成,以預測變數的線性組合為基礎 (如果有兩個群組以上,將產生一組區別函數),而該預測變數,必須能提供群組之間最佳判斷依據。 上述函數從觀察值樣本中產生,而且觀察值的組別成員是已知的,這些函數隨後便可以套用到新的觀察值上,新觀察值會有預測變數的測量,但是,組別成員是未知的。

附註:分組變數可以有兩個 (或以上) 的數值。 但是,分組變數的代碼必須為整數,而且必須指定其最小值和最大值。 觀察值的數值如果超出這個範圍,就不會分析它。

範例。 一般而言,溫帶國家的人,每天消耗的卡路里會比熱帶的人多,而且溫帶地區中,住在都市的人口比例也會比較高。 研究人員想將這些資訊,併成一個函數,以便判斷受訪者對這兩個國家的人民,能細分到什麼樣的程度。 研究人員認為,母體總個數和經濟資訊,應該也相當重要。 因此,使用區別分析,能讓您估計線性區別函數的係數,區別函數的表示式,看起來跟多重線性迴歸方程式的右側內容很像。 亦即是,它也使用 abcd 係數,函數如下:


D = a * climate + b * urban + c * population + d * gross domestic product per capita

如果這些變數,有助於區別兩種不同的氣候區域,那麼溫帶國家和熱帶國家的 D 值就會不同。 如果您使用逐步的變數選取法,可能會發現此函數中,不需要包含四個變數。

統計資料。 適用於每一個變數:平均數、標準差、單變數 ANOVA。 適用於每一個分析:Box's M、組內相關性矩陣、組內共變異數矩陣、各組共變異數矩陣、全體觀察值的共變異數矩陣。 適用於每一個典型區別函數:特徵值、變異數百分比、典型相關、Wilks' Lambda (λ) 值、卡方。 適用於每一個步驟:事前機率、Fisher 函數係數、未標準化函數係數、每個典型函數的 Wilks' Lambda (λ) 值。

區別分析的資料考量

資料。 分組變數的類別必須很明確,而且其類別數也受到限制,它的類別必須以整數編碼。 名義式的自變數,必須重新編碼成虛擬或對比變數。

假設。 觀察值應該是獨立的。 預測變數應該呈多變量常態分佈,而各群組間的群組內變異數 - -共變異數矩陣,應該都是相等的。 各組別成員是假設為互相排斥的 (也就是說,每個觀察值只屬於一個組別),而且整體無遺漏 (也就是說,所有觀察值都是某個組別的成員)。 當組別成員為真的類別變數時,此程序將可發揮最高效能;但如果組別成員是以連續變數的值為基礎 (例如高 IQ 對低 IQ),則請考慮使用線性迴歸,以便利用連續變數本身所提供的豐富資訊。

若要取得區別分析

本功能需要 Statistics Base 選項。

  1. 從功能表中選擇:

    分析 > 分類 > 區別元件 ...

  2. 選取整數值的「分組變數」,再按一下定義範圍,指定需要處理的類別。
  3. 選取自變數或預測變數。 (如果您的分組變數不是整數值,「轉換」功能表上的「自動重新編碼」將可建立變數的分組變數)。
  4. 選取輸入自變數的方法。
    • 一起輸入自變數。 同時輸入所有達到容差條件的自變數。
    • 使用逐步迴歸分析法。 使用逐步迴歸分析法控制變數的輸入和刪除。
  5. 此外,選取具有選擇變數的觀察值。

此程序會貼上 DISCRIMINANT 指令語法。