堪萨斯州梅诺卡岛属性

K-Means-AS 节点图标K-Means 是最常用的聚类算法之一。 它将数据点聚集成多个预定义聚类。 SPSS Modeler 中的 K-Means-AS 节点是用 Spark 实现的。 有关 k-means 算法的更多信息,请参阅 聚类.1

注意:K-Means-AS 节点会自动对分类变量进行单次编码。
表 1。 k曲 sasnode 属性
kmeansasnode 属性 属性描述
roleUse 字符串 指定 predefined 使用预定义角色,或指定 custom 使用自定义字段分配。 默认邮箱为 predefined
autoModel 布尔值 指定 true 即可使用新生成的评分栏的默认名称($S-prediction ),指定 false 即可使用自定义名称。 默认邮箱为 true
features 字段 roleUse 属性设置为 custom 时,用于输入的字段名称列表。
name 字符串 autoModel 属性设置为 false 时,新生成的评分字段名称。
clustersNum 整数 要创建的群集数量。 默认邮箱为 5
initMode 字符串 初始化算法。 可能的值是 k-means||random。 默认邮箱为 k-means||
initSteps 整数 initMode 设置为 k-means|| 时,初始化步骤的数量。 默认邮箱为 2
advancedSettings 布尔值 指定 true 即可使用以下四个属性。 缺省值为 false
maxIteration 整数 聚类迭代的最大次数。 默认邮箱为 20
tolerance 字符串 停止迭代的容错能力。 可能的设置包括 1.0E-11.0E-2、……、 1.0E-6。默认值为 1.0E-4
setSeed 布尔值 指定 true 以使用自定义随机种子。 缺省值为 false
randomSeed 整数 setSeed 属性为 true 时,自定义随机种子。
displayGraph 布尔值 如果您希望在输出中包含图表,请选择此选项。

1 "聚类 - 基于 RDD 的 API" Apache Spark. MLlib: Main Guide. 2024 年 8 月。