笔记本中的 SPSS 预测性分析集群算法

您可以使用可扩展的二步法或集群模型评估算法对 Notebook 中的数据进行集群。

两步聚类

可扩展两步聚类算法基于大家熟悉的两步聚类算法,但在多个方面对其功能和性能进行了扩展。

首先,它能够有效处理由Spark支持的大规模分布式数据,Spark提供了Map-Reduce计算范式。

其次,该算法提供了用于选择最相关特征以对给定数据进行聚类,以及检测罕见异常点的机制。 此外,它还提供了一套增强的评估和诊断功能,以帮助用户深入了解情况。

两步聚类算法首先执行预聚类步骤,通过扫描整个数据集,并将数据样本的密集区域以称为“聚类特征”的汇总统计量形式存储起来。 集群特征存储在内存中,采用一种名为 CF-树的数据结构。 最后,采用聚合式层次聚类算法对这组聚类特征进行聚类。

Python 示例代码:

from spss.ml.clustering.twostep import TwoStep

cluster = TwoStep(). \
    setInputFieldList(["region", "happy", "age"]). \
    setDistMeasure("LOGLIKELIHOOD"). \
    setFeatureImportanceMethod("CRITERION"). \
    setAutoClustering(True)

clusterModel = cluster.fit(data)
predictions = clusterModel.transform(data)
predictions.show()

聚类模型评估

聚类模型评估(CME)旨在通过各种评估指标来解释聚类模型并发现有用的见解。

这是一种通用且独立于任何类型的聚类模型的建模后分析。

Python 示例代码:

from spss.ml.clustering.twostep import TwoStep

cluster = TwoStep(). \
    setInputFieldList(["region", "happy", "age"]). \
    setDistMeasure("LOGLIKELIHOOD"). \
    setFeatureImportanceMethod("CRITERION"). \
    setAutoClustering(True)

clusterModel = cluster.fit(data)
predictions = clusterModel.transform(data)
predictions.show()