Noeuds d'arbre de décisions
Utilisez des modèles d'arbre de décision pour développer des systèmes de classification qui prédisent ou classifient les observations futures en fonction d'un ensemble de règles de décision. Si vos données sont divisées en classes qui vous intéressent (par exemple, les prêts à risque élevé ou faible, les abonnés par rapport aux non-abonnés, les électeurs par rapport aux non-électeurs ou les types de bactéries), vous pouvez utiliser vos données pour créer des règles que vous pouvez utiliser pour classer les anciens ou les nouveaux cas avec une précision maximale. Par exemple, vous pouvez créer une arborescence qui classifie le risque de crédit ou l'intention d'achat en fonction de l'âge et d'autres facteurs.
Cette approche, parfois appelée induction de règle, présente plusieurs avantages. Tout d'abord, le processus de raisonnement derrière le modèle est clairement évident lors de la navigation dans l'arbre. Cela contraste avec les autres techniques de modélisation de la boîte noire dans lesquelles la logique interne peut être difficile à comprendre.
Deuxièmement, le processus inclut automatiquement dans sa règle uniquement les attributs qui sont réellement importants dans la prise de décision. Les attributs qui ne contribuent pas à la précision de l'arborescence sont ignorés. Cela peut fournir des informations très utiles sur les données et peut être utilisé pour réduire les données à des champs pertinents avant d'entraîner une autre technique d'apprentissage, telle qu'un réseau de neurones.
Les nuggets de modèle d'arbre de décision peuvent être convertis en une collection de règles if-then (un ensemble de règles), qui, dans de nombreux cas, affichent les informations sous une forme plus compréhensible. La présentation de l'arbre de décisions est utile lorsque vous souhaitez voir comment les attributs des données peuvent diviser, ou partition, la population en sous-ensembles pertinents pour le problème. La sortie du noeud Tree-AS est différente de celle des autres noeuds Arbre décision car elle inclut une liste de règles directement dans le nugget sans avoir à créer un ensemble de règles. La présentation du jeu de règles est utile si vous voulez voir comment des groupes particuliers d'éléments sont liés à une conclusion spécifique. Par exemple, la règle suivante fournit un profil pour un groupe de voitures qui vaut la peine d'être acheté:
IF tested = 'yes'
AND mileage = 'low'
THEN -> 'BUY'.
Algorithmes de génération d'arbre
Plusieurs algorithmes sont disponibles pour effectuer des analyses de classification et de segmentation. Ces algorithmes fonctionnent tous essentiellement de la même manière, ils examinent tous les champs de votre jeu de données pour trouver celui qui donne la meilleure classification ou prévision en divisant les données en sous-groupes. Le processus est appliqué de manière récursive, en divisant les sous-groupes en unités de plus en plus petites jusqu'à ce que l'arbre soit terminé (comme défini par certains critères d'arrêt). Les champs cible et d'entrée utilisés dans la création d'arbre peuvent être continus (intervalle numérique) ou catégoriels, selon l'algorithme utilisé. Si une cible continue est utilisée, un arbre de régression est généré ; si une cible catégorielle est utilisée, un arbre de classification est généré.
Le noeud Classification and Regression (C & R) Tree génère un arbre de décisions qui vous permet de prévoir ou de classifier les observations futures. La méthode utilise le partitionnement récursif pour diviser les enregistrements d'apprentissage en segments en minimisant l'impureté à chaque étape, où un noeud de l'arbre est considéré comme "pur" si 100% des observations du noeud appartiennent à une catégorie spécifique du champ cible. Les champs cible et d'entrée peuvent être des plages numériques ou des champs catégoriels (nominaux, ordinaux ou indicateurs) ; toutes les divisions sont binaires (seulement deux sous-groupes).
Le noeud CHAID génère des arbres décision à l'aide des statistiques du khi-carré pour identifier les divisions optimales. Contrairement aux noeuds Arbre C&RT et QUEST, CHAID peut générer des arbres non binaires, ce qui implique que certaines divisions possèdent plusieurs branches. Les champs cible et d'entrée peuvent être des champs d'intervalle numérique (continus) ou des champs catégoriels. Le CHAID exhaustif est une modification du CHAID qui effectue un travail plus approfondi d'examen de toutes les divisions possibles, mais dont le calcul prend plus de temps.
Le noeud QUEST fournit une méthode de classification binaire pour la création d'arbres de décisions, conçue pour réduire le temps de traitement requis pour les analyses d'arbre C & RT de grande taille tout en réduisant la tendance des méthodes d'arbre de classification à favoriser les entrées qui permettent davantage de divisions. Les champs d'entrée peuvent être des plages numériques (continues), mais le champ cible doit être catégoriel. Toutes les divisions sont binaires.
Le noeud C5.0 génère un arbre de décision ou un ensemble de règles. Le modèle fonctionne en divisant l'échantillon en fonction du champ qui fournit le gain d'informations maximal à chaque niveau. Le champ cible doit être catégoriel. Plusieurs divisions en plus de deux sous-groupes sont autorisées.
Le noeud Tree-AS est similaire au noeud CHAID existant ; toutefois, le noeud Tree-AS est conçu pour traiter des données volumineuses afin de créer un arbre unique et affiche le modèle résultant dans l'afficheur des résultats qui a été ajouté dans SPSS® Modeler version 17. Le noeud génère un arbre de décision à l'aide des statistiques du khi-carré (CHAID) pour identifier les divisions optimales. Cette utilisation de CHAID peut générer des arbres non binaires, ce qui signifie que certaines divisions ont plus de deux branches. Les champs cible et d'entrée peuvent être des champs d'intervalle numérique (continus) ou des champs catégoriels. Le CHAID exhaustif est une modification du CHAID qui effectue un travail plus approfondi d'examen de toutes les divisions possibles, mais dont le calcul prend plus de temps.
Le noeud Random Trees est similaire au noeud C & RT existant ; toutefois, le noeud Random Trees est conçu pour traiter les données volumineuses afin de créer un arbre unique et affiche le modèle résultant dans le visualiseur de sortie qui a été ajouté dans SPSS Modeler version 17. Le noeud Arbre aléatoire génère un arbre de décision que vous utilisez pour prévoir ou classer les observations futures. La méthode utilise le partitionnement récursif pour diviser les enregistrements d'apprentissage en segments en minimisant l'impureté à chaque étape, où un noeud de l'arbre est considéré comme pur si 100% des observations du noeud appartiennent à une catégorie spécifique du champ cible. Les champs cible et d'entrée peuvent être des plages numériques ou des champs catégoriels (nominaux, ordinaux ou indicateurs) ; toutes les divisions sont binaires (seulement deux sous-groupes).
Utilisations générales de l'analyse arborescente
Voici quelques utilisations générales de l'analyse arborescente:
Segmentation: permet d'identifier les personnes susceptibles d'être membres d'une classe particulière.
Stratification: affecte des observations à l'une des catégories, telles que les groupes à risque élevé, moyen et faible.
Prévision: créez des règles et utilisez-les pour prévoir les événements futurs. La prévision peut également signifier des tentatives d'association d'attributs prédictifs à des valeurs d'une variable continue.
Réduction de données et filtrage des variables: Sélectionnez un sous-ensemble utile de prédicteurs à partir d'un large ensemble de variables à utiliser pour la création d'un modèle paramétrique formel.
Identification des interactions: Identifiez les relations qui appartiennent uniquement à des sous-groupes spécifiques et définissez-les dans un modèle paramétrique formel.
Fusion de catégories et bandes de variables continues: Recode des catégories de prédicteurs de groupe et des variables continues avec une perte d'informations minimale.