Nó de anomalia

Os modelos de detecção de anomalias são utilizados para identificar valores discrepantes, ou casos incomuns, nos dados. Ao contrário de outros métodos de modelagem que armazenam regras sobre casos incomuns, os modelos de detecção de anomalias armazenam informações sobre como é o comportamento normal. Isso permite identificar valores discrepantes mesmo se eles não corresponderem a nenhum padrão conhecido, e pode ser particularmente útil em aplicativos, como detecção de fraude, em que novos padrões surgem constantemente. A detecção de anomalias é um método não supervisionado, o que significa que ele não requer que um conjunto de dados de treinamento contendo casos conhecidos de fraude seja utilizado como um ponto de início.

Ao passo que métodos tradicionais de identificação de valores discrepantes geralmente examinam uma ou duas variáveis por vez, a detecção de anomalias pode examinar grandes números de campos para identificar grupos de clusters ou de peers nos quais registros semelhantes se enquadram. Em seguida, cada registro pode ser comparado com outros em seu grupo de peers para identificar possíveis anomalias. Quanto mais distante um caso estiver do centro normal, mais provavelmente incomum ele deverá ser. Por exemplo, o algoritmo pode agrupar registros em três clusters distintos e sinalizar aqueles que estiverem longe do centro de qualquer cluster.

Cada registro é designado a um índice de anomalias, que é a razão do índice de desvio de grupo com a sua média sobre o cluster ao qual o caso pertence. Quanto maior for o valor deste índice, mais desvios o caso terá além da média. Sob circunstâncias usuais, casos com valores de índice de anomalia menores que 1 ou até mesmo 1,5 não seriam considerados como anomalias porque o desvio é quase o mesmo ou um pouco mais que a média. No entanto, casos com um valor de índice maior que 2 podem ser bons candidatos a anomalias porque o desvio é pelo menos o dobro da média.

A detecção de anomalias é um método exploratório projetado para detecção rápida de casos ou registros incomuns que devem ser candidatos a uma análise adicional. Esses devem ser considerados como anomalias suspeitas que, sob uma análise mais detalhada, podem ou não vir a ser reais. Você pode achar que um registro é perfeitamente válido, mas opta por verificá-lo a partir dos dados para propósitos de construção de modelo. Como alternativa, se o algoritmo descobrir repetidamente falsas anomalias, isso poderá apontar para um erro ou artefato no processo de coleção de dados.

Observe que a detecção de anomalias identifica registros ou casos incomuns por meio de análise de cluster com base no conjunto de campos selecionados no modelo sem levar em consideração nenhum campo de destino específico (dependente) e independentemente se esses campos forem relevantes ao padrão que você está tentando prever. Por essa razão, você pode querer utilizar a detecção de anomalias em combinação com a seleção de variável ou outra técnica para verificar e classificar campos. Por exemplo, é possível utilizar a seleção de variável para identificar os campos mais importantes com relação a um destino específico e, em seguida, usar a detecção de anomalias para localizar os registros que forem mais incomuns com relação a esses campos. (Uma abordagem alternativa seria a construção de um modelo de árvore de decisão e, em seguida, examinar quaisquer registros que forem classificados incorretamente como possíveis anomalias. No entanto, este método seria mais difícil para replicar ou automatizar em grande escala).

Exemplo, Na triagem de concessões de desenvolvimento agrícola para eventuais casos de fraude, a detecção de anomalias pode ser utilizada para descobrir desvios da norma, destacando os registros que forem anormais e que valem a pena realizar uma investigação adicional. Você está particularmente interessado em conceder aplicativos que parecem requerer muito (ou pouco) dinheiro de acordo com o tipo e tamanho da propriedade.

Requisitos. Um ou mais campos de entrada. Observe que apenas os campos com o papel configurado para Entrada usando uma origem ou nó Tipo podem ser utilizados como entradas. Os campos de destino com o papel configurado para Destino ou Ambos são ignorados.

Fortes. Ao sinalizar casos que não estiverem em conformidade com um conjunto conhecido de regras ao invés daqueles que estão, os modelos de Detecção de Anomalias podem identificar casos excepcionais, mesmo quando eles não seguirem padrões conhecidos anteriormente. Quando utilizada em combinação com a seleção de variável, a detecção de anomalias permite verificar grandes quantias de dados para identificar os registros de maior interesse de modo relativamente rápido.