Automatizza la modellazione per un obiettivo flag
Questo tutorial utilizza il nodo Auto Classifier per creare automaticamente e confrontare una serie di modelli diversi per obiettivi flag (ad esempio, se un determinato cliente è suscettibile di non rimborsare un prestito o di rispondere a una particolare offerta) o nominali (definiti).
In questo esempio, si cerca un risultato di tipo flag (sì o no). Nell'ambito di un flusso relativamente semplice, il nodo genera e classifica una serie di modelli candidati, sceglie quelli che funzionano meglio e li combina in un singolo modello aggregato (nell'insieme). Questo approccio combina la facilità di automazione con i vantaggi di combinare più modelli il che spesso fornisce previsioni più precise rispetto a quelle che si possono ottenere da un solo modello.
Questo esempio si basa su una società fittizia che desidera ottenere risultati più redditizi abbinando l'offerta appropriata a ogni cliente. Questo approccio esalta i vantaggi dell'automazione. Per un esempio simile che utilizza un obiettivo continuo (intervallo numerico), vedere l'altro SPSS® Modeler tutorial.
Anteprima del tutorial
Guarda questo video per vedere in anteprima i passaggi di questo tutorial. Potrebbero esserci lievi differenze nell'interfaccia utente mostrata nel video. Il video è pensato come complemento al tutorial scritto. Questo video offre un metodo visivo per apprendere i concetti e le attività descritti in questa documentazione.
Prova il tutorial
In questo tutorial completerai le seguenti attività:
Esempio di flusso del modellatore e set di dati
Questo tutorial utilizza il flusso Modellazione automatizzata per un bersaglio bandiera nel progetto di esempio. Il file di dati utilizzato è pm_customer_train1.csv. L'immagine seguente mostra il flusso del modellatore di esempio.

Questo esempio utilizza il file di dati pm_customer_train1.csv, che contiene dati storici che tracciano le offerte fatte a clienti specifici nelle campagne passate, come indicato dal valore del campaign campo.

Attività 1: Aprire il progetto di esempio
Il progetto di esempio contiene diversi set di dati e flussi di modellazione di esempio. Se non disponi già del progetto di esempio, consulta l'argomento Tutorial per creare il progetto di esempio. Quindi segui questi passaggi per aprire il progetto di esempio:
- Nel menu di navigazione watsonx,
seleziona Progetti > Tutti i progetti.
- Clicca su Progetto " SPSS Modeler ".
- Fai clic sulla scheda Risorse per visualizzare i set di dati e i flussi del modellatore.
Controlla i tuoi progressi
L'immagine seguente mostra la scheda Risorse del progetto. Ora sei pronto per lavorare con il flusso del modellatore di esempio associato a questo tutorial.

Attività 2: Esaminare il nodo Data Asset
La modellazione automatizzata per un bersaglio bandiera include diversi nodi. Segui questi passaggi per esaminare il nodo Data Asset.
- Dalla scheda Risorse, apri il flusso del modellatore Modellazione automatizzata per un target flag e attendi il caricamento dell'area di lavoro.
- Fare doppio clic sul pm_customer_train1.csv nodo. Questo nodo è un nodo Data Asset che punta al pm_customer_train1.csv file nel progetto.
- Rivedere le proprietà del formato file.
- Opzionale: clicca su Anteprima dati per visualizzare l'intero set di dati.
Il numero maggiore di record rientra nella campagna Conto Premium. I valori del campo
campaignsono codificati come numeri interi nei dati (ad esempio2 = Premium account). Successivamente, definisci delle etichette per questi valori che puoi utilizzare per ottenere risultati più significativi.Il file include anche un
responsecampo che indica se l'offerta è stata accettata (0 = no, e1 = yes). Ilresponsecampo è il campo di destinazione, o valore, che si desidera prevedere. Sono inclusi anche vari campi contenenti informazioni demografiche e finanziarie su ciascun cliente. Questi campi vengono utilizzati per costruire o addestrare un modello che prevede i tassi di risposta per individui o gruppi sulla base di caratteristiche quali reddito, età o numero di transazioni mensili.
Controlla i tuoi progressi
L'immagine seguente mostra il nodo Data Asset. Ora sei pronto per modificare il nodo Tipo.

Attività 3: Modifica il nodo Tipo
Dopo aver esplorato la risorsa dati, segui questi passaggi per visualizzare e modificare le proprietà del nodo Tipo :
- Fai doppio clic sul nodo Tipo. Questo nodo specifica le proprietà dei campi, come il livello di misurazione (il tipo di dati contenuti nel campo) e il ruolo di ciascun campo come destinazione o input nella modellazione. Il livello di
misurazione è una categoria che indica il tipo di dati all'interno del campo. Il file dei dati sorgente utilizza tre diversi livelli di misurazione:
- Un campo continuo (come il
Agecampo ) contiene valori numerici continui. - Un campo nominale (come il
Educationcampo ) ha due o più valori distinti; in questo caso.CollegeoHigh school. - Un campo ordinale (come il
Income levelcampo ) descrive dati con più valori distinti che hanno un ordine intrinseco; in questo caso,LowMedium, eHigh.
- Un campo continuo (come il
- Verificare che il campo di risposta # sia il campo di destinazione (Ruolo = Destinazione ) e che la misura per questo campo sia Flag.
Figura 3 Imposta il livello di misurazione e il ruolo 
- Verificare che il ruolo sia impostato su Nessuno per i seguenti campi. Questi campi vengono ignorati durante la creazione del modello.
- ID cliente
- campagna
- data_risposta
- acquisto
- data_acquisto
- codice_prodotto
- Rowid
- X_casuale
- Fare clic su Leggi valori nel nodo Tipo per assicurarsi che i valori siano istanziati.
Come avete visto in precedenza, i dati di origine includono informazioni su quattro diverse campagne, ciascuna mirata a un diverso tipo di account cliente. Queste campagne sono codificate come numeri interi nei dati, quindi per aiutarti a ricordare quale tipo di account rappresenta ciascun numero intero, definisci delle etichette per ciascuno di essi.
Figura 4. Scegliere di specificare i valori per un campo 
- Nella riga # campagna e nella colonna Modalità valore, seleziona Specifica dall'elenco.
- Fai clic sull'icona Modifica
nella riga del campo # campagna.
- Verificare le etichette come mostrato per ciascuno dei quattro valori.
Figura 5. Definire le etichette per i valori dei campi 
- Fare clic su OK. Ora, le etichette vengono visualizzate nelle finestre di output invece dei numeri interi.
- Verificare le etichette come mostrato per ciascuno dei quattro valori.
- Fare clic su Salva.
- Opzionale: fare clic su Anteprima dati per visualizzare il set di dati con le proprietà Tipo applicate.
Controlla i tuoi progressi
L'immagine seguente mostra il nodo Tipo. Ora sei pronto per selezionare una campagna da analizzare.

Compito 4: Selezionare una campagna da analizzare
Sebbene i dati includano informazioni relative a quattro diverse campagne, l'analisi si concentra su una campagna alla volta. Segui questi passaggi per visualizzare il nodo Seleziona per analizzare solo la campagna dell'account Premium:
- Fare doppio clic sul nodo Seleziona per visualizzarne le proprietà.
- Presta attenzione alle condizioni. Poiché il maggior numero di record rientra nella campagna dell'account Premium (codificata
campaign=2nei dati), il nodo Select seleziona solo questi record. - Opzionale: fare clic su Anteprima dati per visualizzare il set di dati con le proprietà selezionate applicate.
Controlla i tuoi progressi
L'immagine seguente mostra il nodo Seleziona. Ora sei pronto per costruire il modello.

Compito 5: Costruire il modello
Ora che hai selezionato una singola campagna da analizzare, segui questi passaggi per creare il modello che utilizza il nodo Auto Classifier :
- Fare doppio clic sul nodo Risposta (classificatore automatico) per visualizzarne le proprietà.
- Espandi la sezione Opzioni di compilazione.
- Nei modelli Rank per campo, seleziona Accuratezza complessiva come metrica utilizzata per classificare i modelli.
- Imposta il numero di modelli da utilizzare su
3. Questa opzione significa che quando si esegue il nodo vengono creati i tre modelli migliori.Figura 6. Opzioni di build del nodo classificatore automatico 
- Espandi la sezione Esperto per visualizzare i diversi algoritmi di modellazione.
- Deseleziona i tipi di modello Discriminante, SVM e Random Forest. Questi modelli richiedono più tempo per l'addestramento su questi dati, quindi la loro eliminazione velocizza l'esempio.
Poiché hai impostato la proprietà Numero di modelli da utilizzare su
3in Opzioni di compilazione, il nodo calcola la precisione degli algoritmi rimanenti e genera un singolo nugget di modello contenente i tre più precisi.Figura 7. Opzioni avanzate per il nodo Classificatore automatico 
- Nelle opzioni Ensemble, seleziona Voto ponderato in base alla confidenza per il metodo ensemble sia per Imposta obiettivi che per Contrassegna obiettivi. Questa impostazione determina il modo in cui viene calcolato un punteggio aggregato unico per ogni record.
Con una votazione semplice, se due modelli su tre prevedono un sì, allora il sì vince con un voto di 2 a 1. Nel caso del voto ponderato in base alla fiducia, i voti vengono ponderati in base al valore di fiducia attribuito a ciascuna previsione. Pertanto, se un modello prevede no con una confidenza superiore rispetto alle due previsioni combinate di sì prevale il no.
Figura 8. Opzioni di insieme del nodo Classificatore automatico 
- Fare clic su Salva.
- Passa con il mouse sul nodo Risposta (classificatore automatico) e fai clic sull'icona
Esegui.
- Nel riquadro Output e modelli, fare clic sul modello denominato risposta per visualizzare i risultati. Vengono visualizzati i dettagli relativi a ciascuno dei modelli creati durante l'esecuzione. (In una situazione reale, in cui potrebbero essere creati centinaia di modelli su un ampio set di dati, l'esecuzione del flusso potrebbe richiedere molte ore.)
- Clicca sul nome di un modello per esplorare i risultati relativi a ciascuno dei singoli modelli.
Per impostazione predefinita, i modelli vengono ordinati in base alla precisione complessiva, poiché tale misura è stata selezionata nelle proprietà del nodo Classificatore automatico. Il modello XGBoost Tree genera una classificazione ottimale in base a questa misura, ma i modelli C5.0 e C&RT sono ugualmente accurati.
In base a questi risultati, si decide di utilizzare tutti e tre questi modelli precisi. Combinando le previsioni di più modelli, è possibile evitare i limiti dei singoli modelli, ottenendo una maggiore accuratezza complessiva.
- Nella colonna USE, verificare che tutti e tre i modelli siano presenti, quindi chiudere la finestra del modello.
Controlla i tuoi progressi
L'immagine seguente mostra la tabella di confronto dei modelli. Ora sei pronto per eseguire l'analisi del modello.

Attività 6: Eseguire un'analisi del modello
Dopo aver esaminato i modelli generati, segui questi passaggi per eseguire un'analisi dei modelli:
- Passa con il mouse sul nodo Analisi e fai clic sull'icona
Esegui.
- Nel riquadro Output e modelli, fare clic sull'output Analisi per visualizzare i risultati.
Il punteggio aggregato generato dal modello combinato viene visualizzato in un campo denominato
$XF-response. Quando viene confrontato con i dati di addestramento, il valore previsto corrisponde alla risposta effettiva (come registrato nel camporesponseoriginale) con un'accuratezza complessiva dell' 92.77 %. Ma non altrettanto preciso come il migliore dei tre singoli modelli in questo caso (92.82% per C5.0), la differenza è talmente piccola per essere significativa. In termini generali, un modello di insieme generalmente si deve eseguire più probabilmente quando applicato a dataset piuttosto che ai dati di addestramento.
Controlla i tuoi progressi
L'immagine seguente mostra il confronto tra modelli che utilizza il nodo Analisi.

Riepilogo
Con questo esempio di flusso di modellazione automatizzata per un target flag, hai utilizzato il nodo Auto Classifier per confrontare diversi modelli, hai utilizzato i tre modelli più accurati e li hai aggiunti al flusso all'interno di un nugget di modello Auto Classifier assemblato.
- In base alle precisione generale, i modelli XGBoost Tree, C5.0 e C&R Tree hanno generato prestazioni migliori sui dati di addestramento.
- Il modello combinato ha ottenuto risultati quasi pari a quelli dei migliori modelli individuali e potrebbe ottenere risultati migliori se applicato ad altri set di dati. Se il tuo obiettivo è automatizzare il processo il più possibile, questo approccio ti aiuta a ottenere un modello solido nella maggior parte dei casi senza dover approfondire le specifiche di un singolo modello.
Passi successivi
Ora sei pronto per provare altri SPSS Modeler tutorial.