自动聚类节点专家选项
通过“自动聚类”节点的“专家”选项卡,您可以应用分区(如果可用),选择要使用的算法以及指定停止规则。
已使用的模型。使用左侧列中的复选框选择要在比较中包括的模型类型(算法)。选择的类型越多,创建的模型就会越多,且处理的时间就会越长。
模型类型。列出可用的算法(请参阅下面的内容)。
模型参数。对于每个模型类型,可以使用缺省设置,或选择指定为每个模型类型选择选项。这些特定选项类似于独立建模节点中可用的选项,不同之处在于可以选择多个选项或组合。例如,比较神经网络模型时,与其选择六种训练方法之一,还不如一次选中全部六种方法以在一次传递中训练六种模型。
模型数。列出根据当前设置为每个算法生成的模型的数目。当组合选项时,模型数会激增,因此强烈建议密切关注该模型数,尤其在使用大型数据集时。
限制构建单个模型所花费的最长时间。(仅限 K-Means、Kohonen、TwoStep、SVM、KNN、Bayes Net 和决策列表模型)为任意一个模型设置最长时间限制。例如,如果由于某些复杂的交互效应,某个特定模型所需的训练时间长得出乎意料,那么您大概不希望它使得整个的建模运行停滞。
支持的算法
|
|
K-Means 节点将数据集聚类到不同分组(或聚类)。此方法将定义固定的聚类数量,将记录迭代分配给聚类,以及调整聚类中心,直到进一步优化无法再改进模型。k-means 节点作为一种非监督学习机制,它并不试图预测结果,而是揭示隐含在输入字段集中的模式。 |
|
|
Kohonen 节点会生成一种神经网络,此神经网络可用于将数据集聚类到各个差异组。此网络训练完成后,相似的记录应在输出映射中紧密地聚集,差异大的记录则应彼此远离。您可以通过查看模型块 中每个单元所捕获观测值的数量来找出规模较大的单元。这将让您对聚类的相应数量有所估计。 |
|
|
TwoStep 节点使用二阶聚类方法。第一步完成简单数据处理,以便将原始输入数据压缩为可管理的子聚类集合。第二步使用层级聚类方法将子聚类一步一步合并为更大的聚类。TwoStep 具有一个优点,就是能够为训练数据自动估计最佳聚类数。它可以高效处理混合的字段类型和大型的数据集。 |
|
|
单类 SVM 节点使用无监督学习算法。此节点可用于新内容检测。它将检测指定样本集的软边界,以便按是否属于该集合对新点进行分类。此单类 SVM 建模节点在 SPSS® Modeler 中使用 Python 进行实现并且需要 scikit-learn© Python 库。 |
|
|
K-Means 是最常用的聚类算法之一。它将数据点聚集成多个预定义聚类。SPSS Modeler 中的 K-Means-AS 节点使用 Spark 进行实现。有关 K-Means 算法的详细信息,请参阅 https://spark.apache.org/docs/2.2.0/ml-clustering.html。请注意,K-Means-AS 节点自动对分类变量执行独热编码。 |