SPSS algorithmes de regroupement pour l'analyse prédictive dans les notebooks

Vous pouvez utiliser l'algorithme d'évaluation évolutif « Two-Step » ou « Cluster » pour regrouper les données dans les carnets de notes.

Cluster en deux étapes

Scalable Two-Step s'appuie sur l'algorithme de regroupement en deux étapes bien connu, mais en améliore à la fois les fonctionnalités et les performances à plusieurs égards.

Tout d'abord, il peut traiter efficacement des volumes importants de données dispersées grâce à Spark, qui repose sur le modèle de calcul Map-Reduce.

D'autre part, l'algorithme propose des mécanismes permettant de sélectionner les caractéristiques les plus pertinentes pour le regroupement des données fournies, ainsi que de détecter les valeurs aberrantes rares. De plus, il offre un ensemble amélioré de fonctionnalités d'évaluation et de diagnostic permettant d'obtenir des informations pertinentes.

L'algorithme de regroupement en deux étapes effectue d'abord une étape de pré-regroupement en parcourant l'ensemble des données et en enregistrant les zones denses d'observations sous forme de statistiques récapitulatives appelées « caractéristiques de grappes ». Les caractéristiques des grappes sont stockées en mémoire dans une structure de données appelée « arbre CF ». Enfin, un algorithme de regroupement hiérarchique agglomératif est utilisé pour regrouper l'ensemble des caractéristiques des clusters.

Python Exemple de code :

from spss.ml.clustering.twostep import TwoStep

cluster = TwoStep(). \
    setInputFieldList(["region", "happy", "age"]). \
    setDistMeasure("LOGLIKELIHOOD"). \
    setFeatureImportanceMethod("CRITERION"). \
    setAutoClustering(True)

clusterModel = cluster.fit(data)
predictions = clusterModel.transform(data)
predictions.show()

Évaluation des modèles de cluster

L'évaluation des modèles de regroupement (CME) vise à interpréter les modèles de regroupement et à dégager des informations utiles à partir de divers indicateurs d'évaluation.

Il s'agit d'une analyse post-modélisation générique et indépendante de tout type de modèle de cluster.

Python Exemple de code :

from spss.ml.clustering.twostep import TwoStep

cluster = TwoStep(). \
    setInputFieldList(["region", "happy", "age"]). \
    setDistMeasure("LOGLIKELIHOOD"). \
    setFeatureImportanceMethod("CRITERION"). \
    setAutoClustering(True)

clusterModel = cluster.fit(data)
predictions = clusterModel.transform(data)
predictions.show()