Dados correspondentes em DataStage

Correspondência em QualityStage® é um sistema de ligação de registro probabilístico que automatiza o processo de identificação de registros que provavelmente representará a mesma entidade. O processo de correspondência melhora a integridade dos seus dados.

Com a correspondência, é possível identificar duplicatas em seus dados, agrupar registros em qualquer conjunto de critérios e construir relações entre os registros em diversos arquivos apesar das variações na representação dos dados e informações ausentes ou imprecisas.

Correspondência de objetivos no DataStage

Algumas metas típicas de correspondência incluem as seguintes:

  • Identificação de registros duplicados de entidades, como indivíduos, empresas, fornecedores, produtos ou eventos
  • Agrupamento de registros com valores iguais ou semelhantes, como o agrupamento de famílias
  • Enriquecimento de dados existentes com novos atributos de fontes externas
  • Localização de entidades em um data warehouse
  • Reconciliação de inventário ou transações

Etapas do ninho:

Depois de identificar suas metas, você define os requisitos do que constitui uma correspondência. Você escolhe quais colunas comparar e como comparar as colunas.

Em seguida, você cria e testa especificações de correspondência personalizadas usando o Match Designer. Essas especificações de correspondência são usadas pelos estágios Two-source Match e One-source Match nos trabalhos DataStage®.

Correspondência no DataStage: conceitos-chave

A vinculação probabilística de registros usa propriedades estatísticas de valores para calcular a probabilidade de que os registros correspondam à mesma entidade. O conteúdo das informações, a integridade, a confiabilidade, a frequência contextual e a representação dos dados são considerados para criar uma avaliação cumulativa da confiança.

A compreensão das informações conceituais é necessária para definir as especificações de correspondência. Você precisa saber como avaliar os resultados, estimar probabilidades, definir limites e executar tarefas relacionadas. É necessário algum conhecimento da teoria de vinculação de registros.

Vinculação de registros e o processo de correspondência no DataStage

Na prática, você compara pares de registros e os classifica em um destes conjuntos: pares correspondentes e pares não correspondentes.

Por esses motivos, são necessários métodos estatísticos de vinculação de registros:
  • As colunas contêm erros ou valores ausentes.
  • Os dados podem não ser confiáveis.
  • Você deseja encontrar as correspondências com uma garantia estatística razoável.
Cenário para vinculação de registros no DataStage

Considere duas fontes de dados. Cada fonte consiste em um número de registros, e os registros contêm um certo número de colunas. Normalmente, cada registro corresponde a uma entidade, e as colunas são atributos que identificam a entidade, como nome, endereço, idade e sexo. O objetivo do processo de vinculação ou correspondência de registros é identificar e vincular os registros em cada fonte que correspondem à mesma entidade. Os registros não contêm identificadores exclusivos totalmente confiáveis que tornam a operação de correspondência trivial. Além disso, todas as colunas individuais estão sujeitas a erros.

As colunas em comum entre as duas fontes são úteis para a correspondência. No entanto, nem todas as colunas contêm a mesma quantidade de informações, e as taxas de erro variam. Por exemplo, uma coluna como Gênero tem apenas dois estados de valor e, consequentemente, não pode transmitir informações suficientes para identificar uma correspondência de forma exclusiva. Por outro lado, uma coluna como FamilyName fornece muito mais informações, mas pode ser frequentemente relatada ou transcrita (digitada) incorretamente.

Você usa pesos para medir a contribuição de cada coluna para a probabilidade de fazer uma classificação precisa. A vinculação de registros tem os seguintes estados: um par de registros é classificado da seguinte forma:

Corresponder: O peso composto está acima de um valor limite (de corte).

Não compatível: O peso composto está abaixo de um segundo valor limite.

Situação indecisa: O peso composto está entre o primeiro e o segundo limites.

Considere o nível de conteúdo de informações no DataStage

Uma ou mais colunas em um registro devem ter colunas equivalentes no outro registro para que possam ser comparadas. Por exemplo, para fazer a correspondência entre o nome da família e a idade, ambos os registros devem ter colunas que contenham informações sobre o nome da família e a idade. Embora para uma correspondência de duas fontes, os metadados das colunas comparáveis não precisem ser idênticos.

Para que um projeto de vinculação de registros seja viável, é possível que um ser humano examine os pares de registros e declare com razoável certeza quais dos pares são correspondentes ou não. Por exemplo, se a única coluna em comum entre duas fontes for o gênero, não se deve concluir que, como o gênero é o mesmo, o par representa o mesmo indivíduo.

O conteúdo de informações mede a importância de uma coluna em relação a outra(valor discriminatório). Por exemplo, um código de gênero contribui com menos informações do que um número de identificação fiscal.

O conteúdo das informações também mede a importância de um valor em uma coluna em relação a outro. Nos Estados Unidos, John contribui com menos informações do que Dwezel em uma coluna GivenName. O nome de batismo John, nos Estados Unidos, é muito mais comum do que o nome de batismo Dwezel. A importância é determinada pela confiabilidade do valor e pela capacidade do valor de distinguir uma correspondência de uma não correspondência. E qualquer comparação de registros precisa de informações suficientes para chegar a uma conclusão confiável. Por exemplo, dois registros de clientes idênticos que contêm apenas o sobrenome Smith e que não apresentam valores em todas as outras colunas de nome e endereço não têm informações suficientes para determinar que os registros representam a mesma pessoa.