堪萨斯州梅诺卡岛属性
K-Means 是最常用的聚类算法之一。 它将数据点聚集成多个预定义聚类。 SPSS Modeler 中的 K-Means-AS 节点是用 Spark 实现的。 有关 k-means 算法的更多信息,请参阅 聚类.1
注意:K-Means-AS 节点会自动对分类变量进行单次编码。
kmeansasnode 属性 |
值 | 属性描述 |
|---|---|---|
roleUse |
字符串 | 指定 predefined 使用预定义角色,或指定 custom 使用自定义字段分配。 默认邮箱为 predefined。 |
autoModel |
布尔值 | 指定 true 即可使用新生成的评分栏的默认名称($S-prediction ),指定 false 即可使用自定义名称。 默认邮箱为 true。 |
features |
字段 | 当 roleUse 属性设置为 custom 时,用于输入的字段名称列表。 |
name |
字符串 | 当 autoModel 属性设置为 false 时,新生成的评分字段名称。 |
clustersNum |
整数 | 要创建的群集数量。 默认邮箱为 5。 |
initMode |
字符串 | 初始化算法。 可能的值是 k-means|| 或 random。 默认邮箱为 k-means||。 |
initSteps |
整数 | 当 initMode 设置为 k-means|| 时,初始化步骤的数量。 默认邮箱为 2。 |
advancedSettings |
布尔值 | 指定 true 即可使用以下四个属性。 缺省值为 false。 |
maxIteration |
整数 | 聚类迭代的最大次数。 默认邮箱为 20。 |
tolerance |
字符串 | 停止迭代的容错能力。 可能的设置包括 1.0E-1、 1.0E-2、……、 1.0E-6。默认值为 1.0E-4。 |
setSeed |
布尔值 | 指定 true 以使用自定义随机种子。 缺省值为 false。 |
randomSeed |
整数 | 当 setSeed 属性为 true 时,自定义随机种子。 |
displayGraph |
布尔值 | 如果您希望在输出中包含图表,请选择此选项。 |
1 "聚类 - 基于 RDD 的 API" Apache Spark. MLlib: Main Guide. 2024 年 8 月。