Nó distinto

Os registros duplicados em um conjunto de dados devem ser removidos antes que a mineração de dados possa começar. Por exemplo, em um banco de dados de marketing, os indivíduos podem aparecer várias vezes com informações diferentes de endereço ou de empresa. É possível usar o nó Distinto para localizar ou remover registros duplicados em seus dados, ou para criar um único registro composto de um grupo de registros duplicados.

Para utilizar o nó Distinto, deve-se primeiro definir um conjunto de campos-chave que determinam quando dois registros são considerados duplicatas.

Se você não selecionar todos os campos como campos-chave, então dois registros "duplicados" poderão não ser realmente idênticos pois eles ainda poderão diferir nos valores dos campos restantes. Neste caso, também é possível definir uma ordenação que é aplicada dentro de cada grupo de registros duplicados. Esta ordenação fornece um controle preciso sobre qual registro é tratado como o primeiro dentro de um grupo. Caso contrário, todas as duplicatas serão consideradas como permutáveis e qualquer registro poderá ser selecionado. A ordem de entrada dos registros não é levada em conta, por isso não ajuda a usar um nó de Sort upstream (veja "Classificação de registros dentro do nó Distinto" nesta página).

Modo. Especifique se deseja criar um registro composto ou incluir ou excluir (descartar) o primeiro registro.

  • Crie um registro composto para cada grupo. Fornece uma maneira de agregar campos não numéricos. Selecionar essa opção torna a guia Composto disponível na qual você especifica como criar os registros compostos.
  • Inclua apenas o primeiro registro em cada grupo. Seleciona o primeiro registro de cada grupo de registros duplicados e descarta o resto. O primeiro registro é determinado pela ordem de classificação definida na configuração Em grupos, classificar os registros por e não pela ordem de entrada dos registros.
  • Descarte apenas o primeiro registro em cada grupo. Descarta o primeiro registro de cada grupo de registros duplicados e seleciona o restante. O primeiro registro é determinado pela ordem de classificação definida na configuração Em grupos, classificar os registros por e não pela ordem de entrada dos registros. Esta opção é útil para localizar duplicatas em seus dados para que você possa examiná-las posteriormente no fluxo.

Campos chave para agrupamento. Lista um ou mais campos utilizados para determinar se os registros são idênticos. Será possível:

  • Adicire campos a esta lista usando o botão do selecionador de campo.
  • Excluir campos da lista utilizando o botão X vermelho (remover).

Em grupos, classificar registros por. Lista os campos utilizados para determinar como os registros são ordenados dentro de cada grupo de duplicatas, e se eles são classificados em ordem crescente ou decrescente. Será possível:

  • Adicire campos a esta lista usando o botão do selecionador de campo.
  • Excluir campos da lista utilizando o botão X vermelho (remover).
  • Mover os campos utilizando os botões para cima ou para baixo, se estiver ordenando mais de um campo.

Uma ordem de classificação deverá ser especificada se você tiver escolhido incluir ou excluir o primeiro registro em cada grupo, de modo que é importante saber qual registro é tratado como o primeiro.

Você também pode desejar especificar uma ordenação se tiver escolhido criar um registro composto para determinadas opções na guia Composto.

Especifique se, por padrão, os registros são classificados em ordem Crescente ou Decrescente dos valores de chave de classificação.

Ordenando registros no nó Distinto

Se a ordem de registros dentro de um grupo de duplicatas for importante, então deve-se especificar a ordem utilizando a opção Nos grupos, ordenar registros por no nó Distinto. Não confie em um nó Ordem de envio de dados. Lembre-se de que a ordem de chegada dos registros não é levado em conta -- apenas a ordem especificada no nó.

Se nenhum campo de classificação for especificado (ou se especificar campos de classificação insuficientes), então os registros dentro de cada grupo de duplicatas estarão não ordenados (ou ordenados incompletamente) e os resultados poderão ser imprevisíveis.

Por exemplo, suponha que temos um conjunto muito grande de registros de log referentes a um número de máquinas. O log contém dados como os seguintes:

Tabela 1. Dados do log da máquina
Registro de data e hora Aprendizado Temperatura
17h00min22s Máquina A 31
13h11min30s Máquina B 26
16h49min59s Máquina A 30
18h06min30s Máquina X 32
16h17min33s Máquina A 29
19h59min04s Máquina C 35
19h20min55s Máquina Y 34
15h36min14s Máquina X 28
12h30min41s Máquina Y 25
14h45min49s Máquina C 27
19h42min00s Máquina B 34
20h51min09s Máquina Y 36
19h07min23s Máquina X 33

Para reduzir o número de registros para o registro mais recente de cada máquina, utilize Machine como o campo-chave e use Timestamp como o campo de classificação (em ordem decrescente). A ordem de entrada não afeta o resultado, porque a seleção de ordenação especifica quais das muitas linhas de uma determinada Máquina devem ser retornadas, e a saída dos dados final seria a seguinte.

Tabela 2. Dados do log da máquina ordenados
Registro de data e hora Aprendizado Temperatura
17h00min22s Máquina A 31
19h42min00s Máquina B 34
19h59min04s Máquina C 35
19h07min23s Máquina X 33
20h51min09s Máquina Y 36