SPSS algoritmos de agrupamento de análise preditiva em notebooks

Você pode usar o algoritmo de avaliação escalável de duas etapas ou o modelo de agrupamento para agrupar dados em cadernos.

Agrupamento em duas etapas

O Scalable Two-Step baseia-se no conhecido algoritmo de agrupamento em duas etapas, mas amplia tanto sua funcionalidade quanto seu desempenho em várias direções.

Em primeiro lugar, ele é capaz de trabalhar de forma eficaz com grandes volumes de dados distribuídos, com o suporte do Spark, que oferece o paradigma de computação Map-Reduce.

Em segundo lugar, o algoritmo oferece mecanismos para selecionar as características mais relevantes para a agrupamento dos dados fornecidos, bem como para detectar pontos atípicos raros. Além disso, oferece um conjunto aprimorado de recursos de avaliação e diagnóstico para facilitar a compreensão.

O algoritmo de agrupamento em duas etapas realiza, em primeiro lugar, uma etapa de pré-agrupamento, examinando todo o conjunto de dados e armazenando as regiões densas de casos de dados na forma de estatísticas resumidas, denominadas características de agrupamento. As características do cluster são armazenadas na memória em uma estrutura de dados chamada árvore CF. Por fim, aplica-se um algoritmo de agrupamento hierárquico aglomerativo para agrupar o conjunto de características dos clusters.

Python código de exemplo:

from spss.ml.clustering.twostep import TwoStep

cluster = TwoStep(). \
    setInputFieldList(["region", "happy", "age"]). \
    setDistMeasure("LOGLIKELIHOOD"). \
    setFeatureImportanceMethod("CRITERION"). \
    setAutoClustering(True)

clusterModel = cluster.fit(data)
predictions = clusterModel.transform(data)
predictions.show()

Avaliação do modelo de agrupamento

A avaliação de modelos de agrupamento (CME) tem como objetivo interpretar modelos de agrupamento e identificar insights úteis com base em diversos indicadores de avaliação.

Trata-se de uma análise pós-modelagem que é genérica e independente de qualquer tipo de modelo de agrupamento.

Python código de exemplo:

from spss.ml.clustering.twostep import TwoStep

cluster = TwoStep(). \
    setInputFieldList(["region", "happy", "age"]). \
    setDistMeasure("LOGLIKELIHOOD"). \
    setFeatureImportanceMethod("CRITERION"). \
    setAutoClustering(True)

clusterModel = cluster.fit(data)
predictions = clusterModel.transform(data)
predictions.show()