Adicionando passes a uma especificação de correspondência em DataStage®
Adiciona um passe para a sua especificação de correspondência para cada processo de correspondência que você deseja executar em seus dados.
Sobre essa tarefa
Especifique as colunas de bloqueio de um passe, comandos de correspondência e valores de corte.
Procedimento
- Clique em Adicionar passe e crie um passe.
- Clique no nome do passe para abrir suas configurações de configuração e clique em Editar correspondências.
- Clique em Editar sob Colunas de especificação de correspondência para adicionar colunas de bloqueio e correspondência.
- Clique em Novo bloco +. Especificar a variável a usar para sua coluna de bloqueio e o tipo de comparação a ser feito nele.
- Select Character comparação quando os valores da coluna de bloqueio são alfanuméricos. Selecione Comparação numérica quando os valores da coluna de bloqueio são numéricos apenas.
Use colunas de bloqueio para criar subconjuntos ou blocos de registros de dados de entrada que provavelmente serão associados. Os registros que possuem os mesmos valores nas colunas de bloqueio são comparados a apenas um outro. Os blocos tornam o processo de correspondência mais rápido e eficiente.
Se você quiser correspondência exata, especifique apenas as colunas de bloqueio. Se você especificar apenas as colunas de bloqueio, todos os pares de registros que contêm os mesmos valores nas colunas de bloqueio são considerados correspondências.
- Clique em Nova correspondência + para adicionar um comando de correspondência para cada variável de ligação que você deseja usar. Selecione a coluna de dados que corresponde à sua variável de linkage e o tipo de comparação. Ver Comparações de correspondência em DataStage para obter uma lista de tipos de comparação.
- No campo m-prob da área Opções de Comando , digite um valor para a probabilidade m (0-1). Esse valor é a probabilidade de que dois registros correspondentes tenham o mesmo valor para a variável linkage.O valor padrão é 0,9.
Para colunas importantes, use 0.999. Para colunas não importantes, use 0.8. Quanto mais alto você definir a m-probabilidade, maior será a penalidade para valores que não coincidem.
A m-probabilidade reflete a taxa de erro de uma coluna. Por exemplo, se valores em uma coluna não coincidem com 10% do tempo, configure m-prob para 0.9. A m-probabilidade também força uma coluna a ser mais importante. Por exemplo, se você deseja que uma coluna tenha uma multa alta para valores não correspondentes, configure m-prob em um valor mais alto como 0.95. O valor mais alto indica que os valores nessa coluna dificilmente serão diferentes e por isso valores diferentes devem resultar em um peso de alta discordância.
- No campo u-prob da área Opções de Comando , digite um valor para o u-probabilidade (0-1). Esse valor é a probabilidade de que dois registros não correspondentes acontetam para ter o mesmo valor para a variável de ligação.O valor padrão é 0,01. Para a maioria dos dados, use o valor padrão de 0.01. O processo de correspondência computa um u-probabilidade preciso ao utilizar os dados de frequência que contém informações de todos os valores em uma coluna. Para a idade, use 0.02. Para o gênero, use 0.5. A probabilidade de que a variável de gênero concorde ao acaso é cerca de 0.5.
- Opcional: Se a sua escolha de comparação permitir a correspondência reversa, selecione Reverso para designar o peso do acordo quando as colunas discordam ou o desacordo de desacordo quando as colunas concordarem.
- Opcional: Se o seu tipo de comparação selecionado suporta vectores, você pode clicar em Vectores para exibir e comparar vetores de coluna. Se você quiser criar vetores para usar em sua especificação de correspondência, consulte Make Vector stage em DataStage.
- Especifique outros parâmetros, dependendo do tipo de comparação.
- Opcional: Na seção Colagem de colunas sob Esquema de entrada, clique nos três pontos próximos a uma coluna para especificar uma substituição de peso. Você pode substituir pesos substituindo o peso calculado com o peso que você especificar ou adicionando o peso que você especifica para o peso calculado com as opções Substituir e Adicionar . Use a opção Scale para substituir valores fora do intervalo de sua frequência com um peso especificado, e escalar os outros valores em proporção aos pesos substituídos. Use uma substituição de peso para evitar correspondências inválidas para valores importantes como números de telefone e endereços, atributendo pesos negativos para penalizar valores ausentes ou inválidos.
- No campo m-prob da área Opções de Comando , digite um valor para a probabilidade m (0-1). Esse valor é a probabilidade de que dois registros correspondentes tenham o mesmo valor para a variável linkage.
- Na janela Configuração do Passe , especifique valores de corte e um valor de estouro.
Especifique um valor de estouro para configurar o número máximo de registros para um bloco. Se o número de registros em um bloco exceder o valor de estouro, os registros nesse bloco não serão correspondidos. Revise Passar estatísticas durante os testes para identificar se um estouro ocorreu e melhorar os critérios de bloqueio ou aumentar o estouro.
Cutoffs são limites que determinam como o resultado de cada comparação de pares de registro é classificado. O peso composto a partir de cada comparação então determina, em relação aos algemados, se aquele par de registro é considerado uma correspondência, um par clerical, uma duplicata ou uma não correspondência.
Dependendo do tipo de correspondência, você pode configurar até três das seguintes algarinas de correspondência.- Correspondência. Os pares de registros com pesos compósitos iguais ou superiores a este corte são considerados correspondências.
- Administrativo. Pares de registros com pesos compósitos que são menores que o corte de correspondência mas igual ou maior do que o corte clerical podem ser revisados para determinar se eles são uma correspondência. Os pares de registros com pesos compósitos que são menores do que o corte clerical são considerados não correspondências e participam do seguinte passe. Você pode eliminar a categoria de revisão clerical, configurando o corte clerical igual ao corte de partidas. Também, este corte não está disponível com o tipo de correspondência transitiva independente ou one-source.
- Duplicar. Você pode configurar um cutoff duplicado para uso com apenas o tipo de correspondência de dois-fonte muitos-para-um-duplicata. Este corte é opcional e deve ser maior do que o corte de correspondência. Cada registro de origem de referência em um par de registros que possui um peso composto igual ou maior que o corte duplicado é categorizado como um registro duplicado.
- Aplicar suas definições e salvar seu passe.
- Para agrupar registros e especificar o tratamento para eles durante a correspondência, clique no nome do passe e clique em Gerenciar grupos.