Como QualityStage corresponde aos registros em DataStage®

A correspondência é uma implementação de vínculo de registro probabilístico. A correspondência é um sistema aberto que você pode ajustar para criar a melhor correspondência para suas necessidades.

Pesos, pontuações e limites

O processo de correspondência designa pontuações numéricas chamadas de pesos para a comparação de elementos de dados individuais. As pontuações medem a contribuição de cada elemento de dados para o peso geral ou composto. O peso composto, por sua vez, é a soma de peso total de todas as comparações definidas. Alguns elementos de dados contribuem com mais peso porque são mais críticos para a partida ou mais confiáveis do que outros. As propriedades estatísticas dos elementos de dados e dos parâmetros de ajuste determinam o peso das contribuições.

O peso para um elemento de dados é gerado usando uma das funções de comparação que estão disponíveis na correspondência. Entre as funções de comparação, estão funções e funções exatas que proporcionam um espectro completo de funções de correspondência tolerantes ou difusas. Você pode ajustar o peso resultante de uma determinada função de comparação para refletir a importância do elemento de dados para o seu domínio e para a comparação geral.

O peso composto é comparado contra um conjunto de limites (também chamado de cutoffs) para determinar como traduzir o peso em uma medição de confiança. A confiança indica a probabilidade de que um par de registros correspondente tenha sido identificado.

Cargas computacionais de grandes volumes de dados

Um processo de correspondência consiste em um ou mais passes. Cada passe emprega uma técnica chamada blocking para reduzir a carga computacional, focando em pares de registros que são mais propensos a serem correspondências. O passe também especifica as colunas e funções de comparação que são usadas para comparar registros.

Para fontes de dados de um tamanho razoável, não é viável comparar todos os pares de registros, pois o número de pares possíveis é o produto do número de registros em cada fonte. Por exemplo, quando você tem duas fontes com como 1000 registros cada um há 1.000.000 combinações de registros, uma de cada fonte. Mas há, no máximo, apenas 1000 partidas possíveis (se não houver duplicações nas fontes). Por isso, o conjunto de pares correspondidos contém, no máximo, 1000 pares, e o conjunto de pares não correspondido contém os 999.000 pares restantes.

Há muitos pares mais não correspondidos do que pares correspondidos. Somente quando se olha para pares de registros que têm alta probabilidade de serem correspondências, e ignoram todos os pares com probabilidades muito baixas, ele se torna viável em um sentido computacional para ligar grandes volumes de dados.