Nó distinto
Os registros duplicados em um conjunto de dados devem ser removidos antes que a mineração de dados possa começar. Por exemplo, em um banco de dados de marketing, os indivíduos podem aparecer várias vezes com informações diferentes de endereço ou de empresa. É possível usar o nó Distinto para localizar ou remover registros duplicados em seus dados, ou para criar um único registro composto de um grupo de registros duplicados.
Para utilizar o nó Distinto, deve-se primeiro definir um conjunto de campos-chave que determinam quando dois registros são considerados duplicatas.
Se você não selecionar todos os campos como campos-chave, então dois registros "duplicados" poderão não ser realmente idênticos pois eles ainda poderão diferir nos valores dos campos restantes. Neste caso, também é possível definir uma ordenação que é aplicada dentro de cada grupo de registros duplicados. Esta ordenação fornece um controle preciso sobre qual registro é tratado como o primeiro dentro de um grupo. Caso contrário, todas as duplicatas serão consideradas como permutáveis e qualquer registro poderá ser selecionado. A ordem de entrada dos registros não é levada em conta, por isso não ajuda a usar um nó de Sort upstream (veja "Classificação de registros dentro do nó Distinto" nesta página).
Modo. Especifique se deseja criar um registro composto ou incluir ou excluir (descartar) o primeiro registro.
- Crie um registro composto para cada grupo. Fornece uma maneira de agregar campos não numéricos. Selecionar essa opção torna a guia Composto disponível na qual você especifica como criar os registros compostos.
- Inclua apenas o primeiro registro em cada grupo. Seleciona o primeiro registro de cada grupo de registros duplicados e descarta o resto. O primeiro registro é determinado pela ordem de classificação definida na configuração Em grupos, classificar os registros por e não pela ordem de entrada dos registros.
- Descarte apenas o primeiro registro em cada grupo. Descarta o primeiro registro de cada grupo de registros duplicados e seleciona o restante. O primeiro registro é determinado pela ordem de classificação definida na configuração Em grupos, classificar os registros por e não pela ordem de entrada dos registros. Esta opção é útil para localizar duplicatas em seus dados para que você possa examiná-las posteriormente no fluxo.
Campos chave para agrupamento. Lista um ou mais campos utilizados para determinar se os registros são idênticos. Será possível:
- Adicire campos a esta lista usando o botão do selecionador de campo.
- Excluir campos da lista utilizando o botão X vermelho (remover).
Em grupos, classificar registros por. Lista os campos utilizados para determinar como os registros são ordenados dentro de cada grupo de duplicatas, e se eles são classificados em ordem crescente ou decrescente. Será possível:
- Adicire campos a esta lista usando o botão do selecionador de campo.
- Excluir campos da lista utilizando o botão X vermelho (remover).
- Mover os campos utilizando os botões para cima ou para baixo, se estiver ordenando mais de um campo.
Uma ordem de classificação deverá ser especificada se você tiver escolhido incluir ou excluir o primeiro registro em cada grupo, de modo que é importante saber qual registro é tratado como o primeiro.
Você também pode desejar especificar uma ordenação se tiver escolhido criar um registro composto para determinadas opções na guia Composto.
Especifique se, por padrão, os registros são classificados em ordem Crescente ou Decrescente dos valores de chave de classificação.
Ordenando registros no nó Distinto
Se a ordem de registros dentro de um grupo de duplicatas for importante, então deve-se especificar a ordem utilizando a opção Nos grupos, ordenar registros por no nó Distinto. Não confie em um nó Ordem de envio de dados. Lembre-se de que a ordem de chegada dos registros não é levado em conta -- apenas a ordem especificada no nó.
Se nenhum campo de classificação for especificado (ou se especificar campos de classificação insuficientes), então os registros dentro de cada grupo de duplicatas estarão não ordenados (ou ordenados incompletamente) e os resultados poderão ser imprevisíveis.
Por exemplo, suponha que temos um conjunto muito grande de registros de log referentes a um número de máquinas. O log contém dados como os seguintes:
| Registro de data e hora | Aprendizado | Temperatura |
|---|---|---|
| 17h00min22s | Máquina A | 31 |
| 13h11min30s | Máquina B | 26 |
| 16h49min59s | Máquina A | 30 |
| 18h06min30s | Máquina X | 32 |
| 16h17min33s | Máquina A | 29 |
| 19h59min04s | Máquina C | 35 |
| 19h20min55s | Máquina Y | 34 |
| 15h36min14s | Máquina X | 28 |
| 12h30min41s | Máquina Y | 25 |
| 14h45min49s | Máquina C | 27 |
| 19h42min00s | Máquina B | 34 |
| 20h51min09s | Máquina Y | 36 |
| 19h07min23s | Máquina X | 33 |
Para reduzir o número de registros para o registro mais recente de cada máquina, utilize
Machine como o campo-chave e use Timestamp como o campo de
classificação (em ordem decrescente). A ordem de entrada não afeta o resultado, porque a seleção de
ordenação especifica quais das muitas linhas de uma determinada Máquina devem ser retornadas, e a saída dos
dados final seria a seguinte.
| Registro de data e hora | Aprendizado | Temperatura |
|---|---|---|
| 17h00min22s | Máquina A | 31 |
| 19h42min00s | Máquina B | 34 |
| 19h59min04s | Máquina C | 35 |
| 19h07min23s | Máquina X | 33 |
| 20h51min09s | Máquina Y | 36 |