決策樹狀結構增長
決策樹狀結構的增長是藉由從資料集建立決策樹狀結構來進行。會選取分割,且在不需要或不可能進一步分割時,將類別標籤指派給葉節點。
增長是從單一根節點開始,其中使用包含訓練資料集的表格作為輸入表格。此表格包含數個代表屬性及單一直欄(代表 class 屬性)的直欄。
預期輸出是以根據訓練資料集的決策樹狀結構模型的表示法來表示。
當您進行分割時,每一個建立的後代節點都對應於訓練資料集的適用子集。將這些節點進一步分割會產生新節點,其對應於資料集的較小子集,依此類推。未進一步分割的節點變成葉節點。
決策樹狀結構增長是重複下列作業:
- 停止準則
這項作業會判斷是否已進行分割,或節點是否變成葉節點,因為它未進一步分割。決策的基礎是對應於該節點的訓練資料集的子集。
如果適用下列其中一個條件,則不會進行分割:
- 相對應子集中的所有實例都是相同類別
- 相對應子集中的實例數小於指定的最小值
- 現行節點的層次大於指定的最大值,其中根節點的層次為 1,其後代節點的層次為 2,依此類推
- 根據最佳可用分割的類別不純度提升小於指定的最小值
- 類別標籤指定
相對應子集中最常用的類別與每一個樹狀結構節點相關聯。如果樹狀結構隨後遭到刪改,則此作業會很有幫助,因為後續的刪改會將部分節點變成葉節點。它也會讓樹狀結構更容易看懂。類別標籤的指定是針對所有節點進行。
- 分割選擇
此作業會將最小不純度分割指派給不符合停止準則的節點。候選分割集包括所有離散屬性的二進位平等分割,以及所有連續屬性的二進位不平等分割。不純度測量會套用至對應於分割結果的子集,以評估候選分割。