Entscheidungsbaumknoten
Die Entscheidungsbaumknoten in SPSS Modeler bieten Zugriff auf die folgenden Algorithmen zur Baumerstellung:
Weitere Informationen finden Sie unter Entscheidungsbaumknoten.
Die Algorithmen sind insofern ähnlich, als sie alle einen Entscheidungsbaum erstellen können, indem sie die Daten rekursiv in kleinere Untergruppen aufteilen. Es gibt jedoch einige wichtige Unterschiede.
Eingabefelder. Die Eingabefelder (Prädiktoren) können einen der folgenden Typen (Messniveaus) aufweisen: stetig, kategorial, Flag, nominal oder ordinal.
Zielfelder. Es kann nur ein Zielfeld angegeben werden. Für C & R Tree, CHAID, Tree-AS und Random Trees kann das Ziel stetig, kategorial, Flag, nominal oder ordinal sein. Für QUEST kann es kategorial, Flag oder nominal sein. Für C5.0 kann das Ziel ein Flag, nominal oder ordinal sein.
Typ der Aufteilung. C & R Tree, QUEST und Random Trees unterstützen nur binäre Aufteilungen (d. h., jeder Knoten des Baums kann in maximal zwei Verzweigungen aufgeteilt werden). Im Gegensatz dazu unterstützen CHAID, C5.0und Tree-AS die Aufteilung in mehr als zwei Verzweigungen gleichzeitig.
Methode für Aufteilung. Die Algorithmen unterscheiden sich in den Kriterien, die zur Entscheidung der Aufteilungen verwendet werden. Wenn C & R Tree eine kategoriale Ausgabe vorhersagt, wird ein Streuungsmaß verwendet (standardmäßig der Gini-Koeffizient, Sie können dies jedoch ändern). Bei stetigen Zielen wird die Methode der kleinsten quadratischen Abweichung verwendet. CHAID und Tree-AS verwenden einen Chi-Quadrat-Test; QUEST verwendet einen Chi-Quadrat-Test für kategoriale Prädiktoren und die Varianzanalyse für stetige Eingaben. Für C5.0 wird ein Informationstheoriemaß verwendet, das Informationsgewinnverhältnis.
Behandlung fehlender Werte. Alle Algorithmen lassen fehlende Werte für die Prädiktorfelder zu, obwohl sie unterschiedliche Methoden verwenden, um sie zu verarbeiten. C & R Tree und QUEST verwenden bei Bedarf Ersatzvorhersagefelder, um während des Trainings einen Datensatz mit fehlenden Werten durch den Baum zu führen. CHAID macht die fehlenden Werte zu einer separaten Kategorie und ermöglicht deren Verwendung bei der Baumerstellung. C5.0 verwendet eine Fraktionierungsmethode, bei der ein Bruchteil eines Datensatzes in jeder Verzweigung des Baums von einem Knoten übergeben wird, bei dem die Aufteilung auf einem Feld mit einem fehlenden Wert basiert.
Bereinigen C & R Tree, QUEST und C5.0 bieten die Option, den Baum vollständig zu erweitern und anschließend durch Entfernen von Aufteilungen der unteren Ebene, die nicht wesentlich zur Genauigkeit des Baums beitragen, zu reduzieren. Mit allen Entscheidungsbaumalgorithmen können Sie jedoch die Mindestgröße der Untergruppe steuern, wodurch Verzweigungen mit wenigen Datensätzen vermieden werden.
Interaktive Baumerstellung. C & R Tree, QUEST und CHAID bieten eine Option zum Starten einer interaktiven Sitzung. Auf diese Weise können Sie Ihren Baum eine Ebene nach der anderen erstellen, die Aufteilungen bearbeiten und den Baum bereinigen, bevor Sie das Modell erstellen. C5.0, Tree-AS und Random Trees verfügen nicht über eine interaktive Option.
A-priori-Wahrscheinlichkeiten. C & R Tree und QUEST unterstützen die Spezifikation von A-priori-Wahrscheinlichkeiten für Kategorien bei der Vorhersage eines kategorialen Zielfelds. A-priori-Wahrscheinlichkeiten sind Schätzungen der allgemeinen relativen Häufigkeit für jede Zielkategorie in der Grundgesamtheit, aus der die Trainingsdaten gezogen werden. Mit anderen Worten, sie sind die Wahrscheinlichkeitsschätzungen, die Sie für jeden möglichen Zielwert erstellen würden, bevor Sie etwas über Prädiktorwerte wissen. CHAID, C5.0, Tree-AS und Random Trees unterstützen die Angabe von A-priori-Wahrscheinlichkeiten nicht.
Regelsätze Nicht verfügbar für Tree-AS oder Random Trees Bei Modellen mit kategorialen Zielfeldern bieten die Entscheidungsbaumknoten die Möglichkeit, das Modell in Form eines Regelsets zu erstellen, was manchmal einfacher zu interpretieren ist als ein komplexer Entscheidungsbaum. Für C & R Tree, QUEST und CHAID können Sie ein Regelwerk aus einer interaktiven Sitzung generieren; für C5.0 können Sie diese Option im Modellierungsknoten angeben. Außerdem können Sie mit allen Entscheidungsbaummodellen ein Regelset aus dem Modellnugget generieren.