propriedades kmeansasnode
K-Médias é um dos algoritmos de armazenamento em cluster mais comumente usados. Ele armazena em cluster pontos de dados em um número
predefinido de clusters. O nó K-Means-AS no SPSS Modeler é implementado no Spark. Para obter mais informações sobre os algoritmos k-means, consulte Clustering.1
Observação: O nó K-Means-AS executa automaticamente a codificação one-hot para variáveis categóricas.
Propriedades kmeansasnode |
Valores | Descrição da propriedade |
|---|---|---|
roleUse |
sequência | Especifique predefined para usar funções predefinidas ou custom para usar designações de campo customizadas. O padrão é predefined. |
autoModel |
Booleano | Especifique true para usar o nome padrão ($S-prediction) para o novo campo de pontuação gerado ou false para usar um nome customizado. O padrão é true. |
features |
campo | Lista dos nomes de campo para entrada quando a propriedade roleUse é configurada como custom. |
name |
sequência | O nome do novo campo de pontuação do gerado quando a propriedade autoModel é configurada como false. |
clustersNum |
Número inteiro | O número de clusters a serem criados. O padrão é 5. |
initMode |
sequência | O algoritmo de inicialização. Os valores possíveis são k-means|| ou random. O padrão é k-means||. |
initSteps |
Número inteiro | O número de etapas de inicialização quando initMode é configurado como k-means||. O padrão é 2. |
advancedSettings |
Booleano | Especifique true para disponibilizar as quatro propriedades a seguir. O patrão é false. |
maxIteration |
Número inteiro | Número máximo de iterações para clusterização. O padrão é 20. |
tolerance |
sequência | A tolerância para parar as iterações. As configurações possíveis são 1.0E-1, 1.0E-2, ..., 1.0E-6. O padrão é 1.0E-4. |
setSeed |
Booleano | Especifique true para usar um valor inicial aleatório customizado. O patrão é false. |
randomSeed |
Número inteiro | O valor inicial aleatório customizado quando a propriedade setSeed é true. |
displayGraph |
Booleano | Selecione esta opção se desejar que um gráfico seja incluído na saída. |
1 "Clustering - API baseada em RDD" Apache Spark. MLlib: Guia principal. Ago 2024.