Clasificar a los clientes de telecomunicaciones

Este tutorial crea un modelo de regresión logística, que es una técnica estadística para clasificar registros basándose en los valores de los campos de entrada. Es análoga a la regresión lineal pero utiliza un campo objetivo categórico en lugar de uno numérico.

Por ejemplo, supongamos que un proveedor de telecomunicaciones ha segmentado su base de clientes según los patrones de uso del servicio, clasificando a los clientes en cuatro grupos. Si los datos demográficos se pueden utilizar para predecir la pertenencia a un grupo, se pueden personalizar las ofertas para cada uno de los posibles clientes.

Vista previa del tutorial

Ver vídeo Mira este vídeo para ver un avance de los pasos de este tutorial. Puede haber ligeras diferencias en la interfaz de usuario que se muestra en el vídeo. El vídeo está pensado como complemento del tutorial escrito. Este vídeo ofrece un método visual para aprender los conceptos y tareas que se describen en esta documentación.

Prueba el tutorial

En este tutorial, completarás las siguientes tareas:

Flujo del modelador de muestras y conjunto de datos

Este tutorial utiliza el flujo Clasificación de clientes de telecomunicaciones del proyecto de ejemplo. El archivo de datos utilizado es telco.csv. La siguiente imagen muestra el flujo del modelador de muestra.

Figura 1. Flujo del modelador de muestras
Flujo del modelador de muestras

La siguiente imagen muestra el conjunto de datos utilizado con este flujo del modelador.

Figura 2. Conjunto de datos de muestra
Conjunto de datos de muestra
Este ejemplo se centra en la utilización de datos demográficos para predecir patrones de uso. El campo de destino custcat tiene cuatro valores posibles que corresponden a los cuatro grupos de clientes, de la siguiente manera:
Tabla 1. Valores posibles para el campo objetivo
Valor Etiqueta
1 Servicio básico
2 Servicio electrónico
3 Servicio Plus
4 Servicio total

Como el objetivo tiene varias categorías, se utiliza un modelo multinomial. Si el objetivo tiene dos categorías distintas, como sí/no, verdadero/falso o abandono/no abandono, se podría crear un modelo binomial en su lugar.

Tarea 1: Abrir el proyecto de ejemplo

El proyecto de ejemplo contiene varios conjuntos de datos y flujos de modelador de ejemplo. Si aún no tiene el proyecto de ejemplo, consulte el tema Tutoriales para crear el proyecto de ejemplo. A continuación, siga estos pasos para abrir el proyecto de ejemplo:

  1. En el menú watsonxMenú de navegaciónNavegación, seleccione Proyectos > Todos los proyectos.
  2. Haga clic en el proyecto « SPSS Modeler ».
  3. Haga clic en la pestaña Activos para ver los conjuntos de datos y los flujos del modelador.

Icono de punto de control Comprueba tu progreso

La siguiente imagen muestra la pestaña Activos del proyecto. Ahora ya está listo para trabajar con el flujo del modelador de muestras asociado a este tutorial.

Proyecto de muestra

Volver al inicio

Tarea 2: Examinar los nodos Data Asset, Type y Filter.

El flujo del modelador de clasificación de clientes de telecomunicaciones incluye varios nodos. Siga estos pasos para examinar tres de los nodos:

  1. En la pestaña Activos, abra el flujo del modelador Clasificación de clientes de telecomunicaciones y espere a que se cargue el lienzo.
  2. Haga doble clic en el telco.csv nodo. Este nodo es un nodo de activo de datos que apunta al telco.csv archivo del proyecto.
  3. Revise las propiedades del formato de archivo.
  4. Opcional: Haga clic en Vista previa de datos para ver el conjunto de datos completo.
  5. Haga doble clic en el nodo Tipo y haga clic en Leer valores. Este nodo especifica las propiedades de los campos, como el nivel de medición (el tipo de datos que contiene el campo) y la función de cada campo como destino o entrada en el modelado. Asegúrese de que todos los niveles de medición estén configurados correctamente. Por ejemplo, la mayoría de los campos con valores de 0.0 y 1.0 pueden considerarse indicadores.
    Figura 3. Niveles de medición
    Tipo Nodo, Niveles de medición

    Tenga en cuenta que gender se considera más correctamente como un campo con un conjunto de dos valores, en lugar de un indicador, por lo que debe dejar su valor de medición como Nominal.
  6. Defina el rol para el campo custcat en Objetivo. Deje el rol para todos los demás campos establecido en Entrada.
  7. Haga doble clic en el nodo Filtro para ver sus propiedades.
  8. Tenga en cuenta que este nodo filtra solo los campos relevantes: region, age, marital, address income, ed, employ,, retire, gender, reside y custcat). Otros campos quedan excluidos de este análisis.

Icono de punto de control Comprueba tu progreso

La siguiente imagen muestra el nodo Filtro. Ahora ya está listo para ver el nodo Logística.

Nodo Filtrar

Volver al inicio

Tarea 3: Ver el nodo Logístico

Siga estos pasos para clasificar a los clientes mediante regresión logística multinomial:

  1. Haga doble clic en el nodo custcat (Logística) para ver sus propiedades.
  2. En la sección Configuración del modelo, seleccione el procedimiento multinomial.
    • Se utiliza un modelo binomial cuando el campo de destino es un campo de indicador o nominal con dos valores discretos.
    • Se utiliza un modelo multinomial cuando el campo de destino es un campo nominal con más de dos valores.
  3. A continuación, seleccione el método Stepwise y el tipo de modelo Efectos principales. Además, seleccione la casilla de verificación Incluir constante en la ecuación.
    Figura 4. Configuración del modelo del nodo logístico
    Configuración del modelo del nodo logístico
  4. En la sección Opciones avanzadas, seleccione el modo Avanzado.
  5. Haga clic en Salida. Seleccione la tabla de clasificación y haga clic en Aceptar.
    Figura 5. Nodo logístico Opciones de salida
    Nodo logístico Opciones de salida

Icono de punto de control Comprueba tu progreso

La siguiente imagen muestra el nodo Logístico. Ahora ya está listo para explorar el modelo.

Nodo Logística

Volver al inicio

Tarea 4: Explorar el modelo

Siga estos pasos para explorar el modelo:

  1. Pase el cursor sobre el nodo custcat (Logística) y haga clic en el icono Icono de ejecuciónEjecutar.
  2. En el panel Resultados y modelos, haga clic en el modelo custcat para ver los resultados.
    Figura 6. Gráfico de importancia de las características del modelo
    Gráfico de importancia de las características del modelo

A continuación, puede explorar la información del modelo, la importancia de la característica (predictor) y la información de estimaciones de parámetros.

Estos resultados se basan únicamente en los datos de entrenamiento. Para evaluar en qué medida el modelo se generaliza a otros datos del mundo real, puede utilizar un nodo Partición para retener un subconjunto de registros con fines de prueba y validación.

Icono de punto de control Comprueba tu progreso

Volver al inicio

Resumen

Este ejemplo le ha mostrado cómo utilizar datos demográficos para predecir patrones de uso mediante la creación de un modelo de regresión logística para clasificar registros basándose en los valores de los campos de entrada.

Próximos pasos

Ahora ya estás listo para probar otros SPSS® Modeler tutoriales.