Pesos e comparações de recordes em DataStage

O conteúdo informativo dos dados determina quais pares de registros são correspondentes e quais não são, tanto para um processo automatizado como a correspondência em DataStage® quanto para a correspondência manual.

Cada coluna dentro de um registro fornece algumas informações. O peso é uma medida do conteúdo informativo dos dados e da probabilidade de um par de registros corresponder. Em conjunto, todas as colunas e comparações determinam o status do par que está sendo examinado pelo processo de correspondência.

Algumas colunas fornecem informações mais confiáveis do que outras. Por exemplo, não faz sentido comparar apenas a coluna de gênero e afirmar que, se houver concordância, o par de registros representa o mesmo indivíduo. No entanto, é mais razoável comparar registros usando um número de identificação individual e afirmar que, se o número for o mesmo, o par de registros representa o mesmo indivíduo. Você pode usar o poder de discriminação de cada coluna para medir e prever correspondências.

Pesos compostos ( DataStage )

Para cada par de registros que você deseja comparar, é calculado um peso composto.

O peso composto é a soma dos pesos individuais de todas as comparações de correspondências. É a medida da confiança de que os dois registros são compatíveis.

Cálculo dos pesos ( DataStage )

Os pesos de correspondência medem o grau de correspondência entre dois registros com base nos critérios de correspondência designados. Os pares de registros com pesos mais altos são uma correspondência mais forte do que os pares de registros com pesos mais baixos.

A razão de chances é a relação entre as chances de um evento ocorrer em um grupo e as chances de o evento ocorrer em outro grupo. Uma razão de chances igual a um (1) implica que o evento é igualmente provável em ambos os grupos. Uma razão de chances maior que um (>1) implica que o evento é mais provável no primeiro grupo. Uma razão de chances inferior a um (< 1) implica que o evento é menos provável no primeiro grupo.

O cálculo do peso para uma coluna usa a razão de chances da probabilidade de os valores serem iguais e o par de registros ser uma correspondência versus a probabilidade de as chances dos valores serem iguais e o par de registros não ser uma correspondência. O uso dessa razão de chances minimiza o número de pares administrativos para os valores de corte escolhidos.

Ponderações de concordância e discordância

O peso da correspondência é obtido utilizando os pesos de concordância e discordância estabelecidos para essa coluna.

Se uma comparação de correspondência concordar com o par de registros que está sendo comparado, o peso da concordância é adicionado ao peso composto. O peso do acordo é um valor positivo. Se uma comparação de correspondência discordar do par de registros que está sendo comparado, o peso da discordância é adicionado. O peso da discordância é um valor negativo. Portanto, os pesos de concordância são adicionados ao peso composto, e os pesos de discordância são subtraídos do peso composto. Quanto maior for a pontuação, maior será a concordância.

É atribuído um peso parcial para correspondências não exatas ou imprecisas.

Os valores ausentes têm um peso padrão de zero.

Confiabilidade e concordância aleatória

Confiabilidade: uma discussão sobre m-prob

A probabilidade m é a probabilidade de um valor de coluna concordar com seu valor de par, dado que o par de registros que está sendo examinado é um par correspondente. A probabilidade m é efetivamente um menos a taxa de erro da coluna. Por exemplo, em uma amostra de registros correspondentes, se o gênero discordar 10% das vezes devido a erros de transcrição ou relatórios incorretos, a probabilidade m para essa variável é 0.9 (1 - 0.1 ).

Uma probabilidade m elevada ( 0.9 ) indica que os dados numa determinada coluna são considerados altamente confiáveis. Quanto maior for a probabilidade m, maior será o peso da discordância. Uma discordância entre dois valores em uma coluna confiável é penalizada mais severamente do que em uma coluna não confiável para a qual você definiu uma probabilidade m baixa ( 0.1 ).

Se uma coluna for importante, então a probabilidade m pode receber valores mais altos. Se a probabilidade m for alta, isso equivale a dizer que uma discordância de valores dessa coluna é um evento raro em um par correspondente. Consequentemente, a penalidade por uma não correspondência é elevada.

Acordo aleatório: uma discussão sobre u-prob

A probabilidade u é a probabilidade de um valor de coluna concordar com seu valor de par, dado que o par de registros que está sendo examinado é um par não correspondente. Como há muito mais pares não correspondentes do que pares correspondentes, a probabilidade u é, na prática, a probabilidade de os valores coincidirem aleatoriamente.

O Match utiliza uma análise de frequência para determinar a probabilidade de uma concordância aleatória para todos os valores.

Valores raros conferem mais importância a uma partida.

Por exemplo, a probabilidade de dois valores de gênero coincidirem aleatoriamente é de cerca de 0.5. Dada uma distribuição uniforme, existem quatro combinações possíveis dos dois valores:
Tabela 1. Possíveis combinações dos valores de gênero para um par de registros
Arquivo A arquivo B
M F
M M
F M
F F

O gênero concorda em duas das quatro combinações. Portanto, o par tem uma probabilidade u de 0.5.

Cálculos de pesos

Os pesos das colunas refletem tanto a confiabilidade dos dados quanto a possibilidade de concordância aleatória.

O peso do acordo para uma coluna é calculado como o logaritmo na base dois da razão entre a probabilidade m e a probabilidade u, conforme mostrado na seguinte equação:
log2(m probability/(u probability)
O peso da discordância para uma coluna é calculado conforme mostrado na seguinte equação:
log2((1 - m probability)/(1 - u probability))

Exemplo de peso do acordo

Os números relativos ao gênero e à identidade nacional demonstram como as diferenças na frequência ou confiabilidade alteram o peso da concordância para as colunas.

Para ver como o cálculo do peso se traduz em valores reais, considere os valores das colunas, sexo e número de identidade nacional. Neste exemplo, o gênero tem uma taxa de erro de 10% e o número de identidade nacional tem uma taxa de erro de 40%.

A probabilidade m para o gênero é 0.9. A probabilidade u é 0.5. Portanto, o peso para o gênero é mostrado no exemplo a seguir:


log2 (m/u) = ln(m/u)/ln(2) = ln(0.9/0.5)/ln(2) = 0.85.

De forma conservadora, suponha que a probabilidade de uma coincidência aleatória do número de identidade nacional seja de uma em 10 milhões. Dado m como 0.6 (taxa de erro de 40% em pares correspondentes), o peso para o número de identidade nacional é ln( 0.6/0.0000001 ) = 22.51.

Portanto, o peso para uma correspondência na coluna de gênero é 0.85, e uma correspondência no número de identidade nacional é 22.51. Os pesos capturam o que você pode saber intuitivamente sobre as colunas.

Valores de corte ( DataStage )

Cortes de correspondência e administrativos são limites que determinam como categorizar pares de registros marcados.

Seu objetivo ao definir limites é minimizar a incerteza nos resultados da correspondência, ao mesmo tempo em que limita o número de categorizações falsas.

Os pares de registros com pesos compostos iguais ou superiores ao limite de correspondência são considerados correspondências. Os pares de registros com pesos compostos iguais ou superiores ao limite administrativo, mas inferiores ao limite de correspondência, são chamados de pares administrativos. O processo de correspondência é incerto quanto ao fato de os pares administrativos serem correspondentes ou não. Os pares com pesos compostos abaixo do limite administrativo são considerados incompatíveis. Você pode definir limites com o mesmo valor, para eliminar registros administrativos.

Você pode definir um limite alto para restringir os resultados a correspondências de melhor qualidade, embora possivelmente com menos correspondências. Um limite mais baixo pode produzir mais correspondências, mas algumas delas podem ser de menor qualidade. Os requisitos comerciais ajudam a orientar as decisões. Os resultados podem variar dependendo se você adota uma abordagem conservadora ou mais agressiva para definir os valores de corte.

Por exemplo, a correspondência com o objetivo de deduzir o salário de uma pessoa pode exigir uma abordagem mais conservadora do que a deduplicação de uma lista de endereços para catálogos de compras. Como prática recomendada, tenha em mente o objetivo comercial ao ajustar as configurações de correspondência.

Os pesos compostos atribuídos a cada par de registros criam uma distribuição de pontuações que variam de muito positivas a muito negativas. O gráfico da Figura 1 concentra-se na área de um histograma onde o número de pares com pontuação baixa diminui e os pares com pontuação alta começam a aumentar. Nesta área do gráfico, não há uma grande probabilidade de os pares serem correspondências ou não correspondências.

Você define os valores de corte para informar ao processo de correspondência como lidar com pares nesse intervalo. As diferenças na distribuição dos pares ajudam a determinar as configurações. Os detalhes do gráfico de registros correspondentes versus não correspondentes referem-se aos pontos de corte. Normalmente, você define limites na inclinação descendente dos não correspondentes e na inclinação ascendente dos correspondentes. O ponto em que você define o limite é influenciado tanto pelo objetivo comercial quanto pela tolerância ao erro.

Os pesos entre as linhas verticais formam uma área cinzenta, onde não se pode dizer se o par é compatível ou não. Você deseja ter variáveis suficientes para distribuir os grupos correspondentes e não correspondentes mais distantes uns dos outros (minimizar os pares incertos). Você sabe que desenvolveu uma boa estratégia de correspondência quando o que está na área administrativa são registros com valores em branco, ausentes e padrão.

Figura 1. Histograma de pesos
O histograma mostra o número de pares no eixo vertical e o peso da comparação no eixo horizontal. Na extremidade inferior da comparação de pesos, existem registros não correspondentes à esquerda do limite inferior e, na extremidade superior da comparação de pesos, existem registros correspondentes à direita do limite superior. Registros administrativos entre o limite inferior e superior. A área cinza é a área do meio, entre as áreas de não correspondência e correspondência, e é identificada como área administrativa.

Quanto menos registros na área administrativa, menos casos para revisar, mas maior a probabilidade de erros.

Falsos positivos são casos em que os registros são classificados como registros correspondentes, mas na verdade são registros não correspondentes. Falsos negativos são casos em que os registros são classificados como registros sem correspondência, mas são registros com correspondência.

O objetivo de definir limites é minimizar o número de pares administrativos e limitar o número de falsos negativos e positivos. Você ajusta os resultados de acordo com os objetivos da sua organização.

Diretrizes para determinar a probabilidade ( DataStage )

Você pode usar essas diretrizes ao atribuir probabilidades.

Quanto maior for a probabilidade m, maior será o peso da discordância. Portanto, se uma coluna for importante, atribua a ela valores de probabilidade mais elevados. Se a probabilidade m for alta, isso equivale a dizer que uma discordância nessa coluna é um evento raro em um par correspondente e, consequentemente, a penalidade por uma não correspondência é alta. Os pesos calculados a partir das probabilidades são visíveis no visualizador de dados do Match Designer, para que você possa inspecionar os resultados.

Use as seguintes diretrizes ao determinar as probabilidades m.

  • Atribua probabilidades m elevadas às colunas que são mais importantes e confiáveis.
  • Atribua probabilidades m mais baixas às colunas que frequentemente apresentam erros ou estão incompletas.
  • A probabilidade m deve ser sempre maior que a probabilidade u e nunca deve ser zero ou 1.

A concordância ou discordância entre os valores dos dados é mais significativa para dados confiáveis e menos significativa para dados não confiáveis.

Como ponto de partida, você pode estimar a probabilidade u, pois o processo de correspondência substitui qualquer estimativa por valores reais. Uma boa estimativa é definir a probabilidade u como 1 /n valores, onde n é o número de valores únicos para a coluna. Por padrão, a probabilidade u para cada comparação é calculada automaticamente pelo processo de correspondência usando as informações de frequência da etapa Frequência. Essa probabilidade u calculada é importante para colunas com distribuições não uniformes.

As informações de frequência permitem que a correspondência varie os pesos de acordo com os valores específicos de uma coluna. Valores raros conferem mais importância a uma partida. Por exemplo, ao usar uma coluna como FamilyName,, os valores Smith e Jones são comuns nos Estados Unidos. No entanto, um valor como o de Alcott é relativamente raro nos Estados Unidos. Uma correspondência com o sobrenome raro Alcott recebe um peso maior do que uma correspondência com sobrenomes mais comuns, pois a probabilidade de coincidência aleatória com Alcott é relativamente baixa em comparação com coincidências aleatórias com outros valores, como Smith ou Jones.

Para colunas com uma distribuição uniforme de valores e um número elevado de valores diferentes (como números de identificação individuais), é melhor não gerar informações de frequência. Especifique o tipo de variável NOFREQ na janela Tratamento especial de variáveis do Match Designer.

Mesmo a correspondência exata está sujeita às mesmas leis estatísticas que a correspondência probabilística. É possível ter dois registros que contenham valores idênticos e, ainda assim, não representem a mesma entidade. Não é possível tomar uma decisão definitiva quando não há informações suficientes.