Configurações padrão de enriquecimento de metadados
Para obter resultados de enriquecimento de metadados úteis, configure configurações padrão para todos os enriquecimentos de metadados em um projeto. As configurações padrão também ajudam a garantir o uso consistente das opções de enriquecimento.
As mudanças nas configurações de limite ou nos métodos de designação de termo selecionados são aplicadas a novos enriquecimentos de metadados e a tarefas de enriquecimento que são executadas após a mudança das configurações. As mudanças no conjunto de categorias são aplicadas somente a novos enriquecimentos.
- Permissões necessárias
- Para definir as configurações padrão de enriquecimento de metadados, deve-se ter a função Admin no projeto Qualquer colaborador do projeto pode visualizar as configurações.
É possível acessar as configurações padrão de uma destas maneiras:
- Dentro de um ativo de enriquecimento de metadados existente, clique em Configurações padrão
- Na página Gerenciar do projeto, acesse Ferramentas> Enriquecimento de metadados.
Editar configurações conforme necessário. Suas mudanças são salveadas automaticamente Para algumas configurações, é possível restaurar os valores padrão definidos pelo sistema a qualquer momento.
Defina as configurações padrão para estes recursos:
- Criação de perfil e análise da chave primária
- Expandir metadados
- Designação de termos e classificação
- Configurações avançadas de criação de perfil
- Origens da verificação da qualidade dos dados
- Verificações da qualidade dos dados a serem identificadas
- Coletar dados históricos
- Saída de qualidade de dados
- Análise de relacionamento-chave
Você também pode criar, atualizar ou recuperar configurações de enriquecimento com APIs em vez da interface com o usuário. Os links para as APIs estão listados na seção Saiba mais .
Se o uso de IA generativa no enriquecimento de metadados estiver desativado para um projeto, as configurações de enriquecimento correspondentes estarão inativas e você não poderá selecioná-las:
- Geração de nomes baseada em IA. Apenas a correspondência aproximada está disponível.
- Geração de descrições.
- Atribuição de termos comerciais baseada em IA.
Em um projeto com enriquecimentos de metadados executados anteriormente, os resultados baseados em IA ainda estão disponíveis, mas não são atualizados após a desativação do uso da IA gen.
Criação de perfil e análise da chave primária
Defina limites para criação de perfil, classe de dados e atribuição de chave primária, e pré-selecione categorias. A qualquer momento, pode-se restaurar o padrão para qualquer configuração de limite que você mudou.
Nulidade
Os campos de dados em uma coluna ou um arquivo simples são anuláveis se eles forem autorizados a não ter valor.
- Limite nulo
- Determina se um campo de coluna ou arquivo simples permite valores nulos. Se uma coluna ou arquivo simples tiver campos sem valores, a porcentagem dos campos vazios localizada é comparada ao limite configurado. Se for igual ou maior que o limite de nulidade, o campo permitirá valores nulos. Se valores nulos não existirem no campo de dados ou a porcentagem de frequência for menor que o limite, o campo de dados deve ter um valor. A configuração padrão é 5%.
Cardinalidade
A cardinalidade de uma coluna pode ser única, constante ou não restringida. A porcentagem de valores distintos exclusivos e a porcentagem de valor constante mais frequente localizados são comparados com os níveis estabelecidos. O tipo de cardinalidade será exclusivo ou constante se a respectiva porcentagem for igual ou maior que a porcentagem limite. Caso contrário, não será restringido.
- Limite de Exclusividade
- Determina se um campo de dados contém valores exclusivos. Uma coluna ou um arquivo simples é considerado único se ele possui uma porcentagem de valores distintos igual ou superior ao limite que você configurou. O padrão é 95%.
- Limite de Constante
- Determina se uma coluna ou arquivo simples contém valores constantes. É determinado que um campo é constante se ele possui um único valor distinto com uma porcentagem de frequência igual ou maior que o limite constante que você configurou. O padrão é 99%.
Designação da classe de dados
As classes de dados que estão incluídas no enriquecimento de metadados são automaticamente atribuídas a uma coluna unicamente durante o profiling. As designações de termo não têm impacto nas atribuições de classe de dados. Os limites determinam o nível de confiança mínimo para uma classe de dados a ser designada ou sugerida. O limite de designação deve ser maior do que o limite de sugestão.
As classificações relacionadas também podem ser atribuídas automaticamente para classes de dados atribuídas automaticamente.
Você pode controlar esse comportamento ativando ou desativando a opção de atribuição de classificação para classes de dados. Consulte Atribuição de classificação.
- Limite de designação
Determina a porcentagem mínima de valores para os quais a classe de dados deve corresponder aos critérios a serem designados automaticamente a uma coluna.. A configuração padrão é 75%. Esta configuração pode ser substituída por um limite definido diretamente sobre a classe de dados.
As seguintes classes de dados predefinidas possuem um conjunto de limites padrão:
- Cidade (50%)
- Nome da Pessoa (50%)
- Primeiro Nome (50%)
- Nome do Meio (50%)
- Sobrenome (50%)
- Nome da Organização (60%)
Consulte Incluindo correspondência de dados em classes de dados.
- Limite de sugestão
Determina a porcentagem mínima de valores para os quais a classe de dados deve corresponder aos critérios a serem sugeridos para uma coluna A configuração padrão é 25%.
Chaves primárias
Uma chave primária pode consistir em uma ou mais coluna e identificar exclusivamente cada registro em uma tabela. Cada tabela pode ter apenas uma chave primária
- Limite de sugestão
- Define a confiança mínima para uma coluna ou uma combinação de colunas a ser sugerida como chave primária. A configuração padrão é de 80%
Análise incremental para dados em fluxo contínuo
Por padrão, os ativos de dados provenientes de plataformas de streaming, como Apache Kafka, são analisados na íntegra apenas na análise inicial. Nas análises subsequentes, são considerados apenas os registros recém-adicionados. Se você quiser que todos os registros sejam sempre analisados, desmarque essa opção.
Essa opção não se aplica a análises avançadas, como a criação de perfis de dados avançados. A análise avançada é sempre realizada em todo o conjunto de dados.
Para obter mais informações sobre o processamento de dados em fluxo contínuo, consulte “Conectores compatíveis para descoberta, enriquecimento e qualidade de dados: conectores de fluxo de dados ”.
Categorias
Você pode limitar o conjunto de categorias a partir das quais os usuários podem selecionar quando criam novos enriquecimentos de metadados para as categorias que se alinhar com a finalidade do projeto. Observe que esta seleção não determina quais categorias são realmente usadas em um enriquecimento de metadados. Pré-selecionar categorias que são relevantes para o projeto. As categorias selecionadas determinam os termos de negócios e classes de dados que podem ser utilizados para a atribuição de perfil e atribuição de termo automático. Esta seleção não limita as opções dos usuários ao designar classes de dados ou termos manualmente. Para as designações manuais, os usuários podem selecionar classes de dados ou termos de negócios de qualquer categoria a que tenham acesso.
Quaisquer alterações neste conjunto são refletidas em novos enriquecimentos de metadados e quando você edita um enriquecimento de metadados existente.
Expandir metadados
Configure as definições padrão a serem aplicadas para gerar nomes de exibição ou descrições para ativos de dados e as colunas que eles contêm.
Nome de exibição
Defina as configurações padrão para a produção de nomes semânticos para ativos de dados e as colunas que eles contêm como nomes alternativos que são mais descritivos do que os nomes de origem. Esses nomes alternativos podem ser designados ou sugeridos automaticamente
Defina limites para determinar o nível mínimo de confiança para que um nome semântico seja atribuído ou sugerido como nome de exibição. O limite de designação deve ser maior do que o limite de sugestão.
- Limite de designação
- Determina a confiança que deve ser excedida para que um nome de exibição seja atribuído automaticamente a um ativo de dados ou coluna. A configuração padrão é 90%.
- Limite de sugestão
- Determina a confiança que deve ser excedida para que um nome de exibição seja sugerido para um ativo de dados ou coluna. A configuração padrão é 75%.
Você pode escolher entre dois métodos para gerar nomes de exibição. Ambos os métodos utilizam abreviações definidas como termos comerciais nas categorias selecionadas para enriquecimento como fonte padrão para a expansão de nomes. Aplicam-se as seguintes regras para o uso de abreviações:
- As abreviações parciais são comparadas de forma independente. Por exemplo, o nome
hh_xref_idde uma coluna é resolvido por meio do uso de entradas separadas no glossário parahh,xref, eid, que são então combinadas para formar o nome completo. - Se a mesma abreviação aparecer mais de uma vez, será utilizada a primeira ocorrência.
O mecanismo de abreviação utilizado para a atribuição de termos com base na correspondência de nomes é distinto do mecanismo de abreviação descrito aqui. O arquivo de abreviações para a atribuição de termos com base na correspondência de nomes é interno e não pode ser configurado. Após a execução da expansão semântica e a aceitação dos nomes expandidos pelo usuário, esses nomes ficam disponíveis para os métodos de atribuição de termos posteriores (baseados em IA generativa, baseados em regras e por correspondência de nomes).
Selecione um destes métodos:
- Correspondência difusa
A correspondência difusa gera nomes de exibição com base em um glossário incorporado e em abreviações de termos comerciais existentes nas categorias selecionadas para enriquecimento. A correspondência difusa é útil se você trabalha com um vocabulário comercial específico do domínio ou se a sua implantação não atende aos requisitos do sistema para trabalhar com modelos básicos. Se o seu sistema atender aos requisitos, você poderá mudar para o uso de IA generativa a qualquer momento.
Não há nenhum LLM envolvido. O glossário é comparado de forma aproximada aos metadados para gerar nomes expandidos. Como todo o glossário da área impulsiona a expansão, é importante que seu vocabulário inclua uma cobertura abrangente de abreviações.
Essa é a configuração padrão para projetos que foram criados antes de 25 de julho de 2025.
- IA generativa
Com a IA generativa, utiliza-se um modelo de base para a geração de nomes. Se você selecionar essa opção, poderá enviar contexto adicional ao modelo de fundação para melhorar a precisão dos nomes gerados.
O LLM pode expandir abreviações comuns (por exemplo, SSN ou ID) com base em seu próprio conhecimento, mas as abreviações específicas de um domínio devem provir dos termos de negócios contidos no vocabulário de negócios ou de um arquivo de abreviações personalizado. A correspondência com o vocabulário de negócios é exata: se um token no nome da coluna corresponder a uma entrada de abreviação, o valor expandido dessa entrada é passado ao modelo como contexto.
Essa é a configuração padrão para projetos que foram criados em 25 de julho de 2025 ou após essa data.
- Usar dados da amostra gerados pela criação de perfil
Para usar alguns dos dados que são amostrados para criação de perfil como contexto para gerar nomes de exibição, ative essa opção. Um subconjunto dos dados coletados é enviado para o modelo de base em sua instância desse serviço de nuvem como contexto adicional para os prompts de enriquecimento para melhorar a precisão da saída. Essas amostras de dados não são usadas para melhorias gerais de produtos ou modelos. Você precisa consentir com esse uso quando ativar a opção.
- Use um conjunto customizado de abreviações
Importar arquivos de abreviação como ativos de dados para o projeto. No projeto, clique em Importar ativos > Arquivo local > Ativo de dados para procurar o sistema de arquivos local e carregar os arquivos de abreviação.
Os arquivos devem obedecer a uma convenção de nomes e a um formato específicos. Para obter mais informações, consulte Arquivos de abreviações personalizadas.
- Usar ativos com nomes de exibição designados
Use ativos de dados com nomes de exibição revisados e atribuídos do projeto atual ou de um catálogo específico como contexto.
Descrições geradas por IA
A IA gerativa pode produzir descrições para ativos de dados inteiros, e para as colunas que um ativo de dados contém. Um modelo básico leva em consideração o contexto dos ativos e das colunas para fornecer descrições significativas. Essas descrições podem ser designadas ou sugeridas automaticamente Os limites determinam o nível mínimo de confiança para uma descrição a ser designada ou sugerida O limite de designação deve ser maior do que o limite de sugestão.
Você pode escolher se deseja que as descrições sejam geradas usando um modelo de base. Por padrão, a geração de descrições está ativada. Se quiser trabalhar apenas com descrições importadas da fonte de dados ou adicionadas manualmente, você pode desativar esse recurso a qualquer momento.
- Limite de designação
- Determina a confiança que deve ser excedida para que uma descrição gerada seja automaticamente atribuída a um ativo ou coluna de dados. A configuração padrão é 100%.
- Limite de sugestão
- Determina a confiança que deve ser excedida para que uma descrição gerada seja sugerida para um ativo ou coluna de dados. A configuração padrão é 75%.
Designação de termos e classificação
Defina limites para a atribuição de termos comerciais, selecione os métodos para atribuição de termos e determine se as classificações podem ser atribuídas automaticamente. A qualquer momento, você pode restaurar o padrão para qualquer configuração que tenha sido alterada.
Designação de termo
Os termos de negócio que estão incluídos no enriquecimento de metadados (por meio da seleção de categoria) podem ser automaticamente designados ou sugeridos para uma coluna. Os limites determinam o nível de confiança mínimo para um termo a ser designado ou sugerido. O limite de designação deve ser maior do que o limite de sugestão. Observe que as designações de termo não afetam as designações de classe de dados. Se um termo que é associado a uma classe de dados for atribuído a uma coluna por um modelo ML ou através de correspondência de nomes, a classe de dados relacionada não será automaticamente designada também.
As classificações relacionadas também podem ser atribuídas automaticamente para termos atribuídos automaticamente.
Você pode controlar esse comportamento ativando ou desativando a opção de atribuição de classificação para termos. Consulte Atribuição de classificação.
- Limite de designação
Determina a porcentagem de valores correspondentes que devem ser excedidos para que um termo seja designado automaticamente a um ativo de dados ou coluna A configuração padrão é 90%.
- Limite de sugestão
Determina a porcentagem de valores correspondentes que devem ser excedidos para um termo a ser sugerido para um ativo de dados ou coluna A configuração padrão é 75%.
Dica: Se a atribuição de termos baseada em IA for selecionada como um dos métodos de atribuição de termos, considere reduzir esse limite para um valor entre 65% e 70%. Caso contrário, os termos retornados por esse método podem não ser considerados para a atribuição de termos porque as pontuações de confiança são geralmente mais baixas do que as pontuações dos outros métodos.
Determine qual método de designação de termo é usado no projeto para gerar designações e sugestões. Designações e sugestões são feitas com base na pontuação de confiança mais alta que um dos métodos retorna. Selecione pelo menos um destes métodos:
Machine Learning: um modelo de aprendizado de máquina é usado para designar termos. É possível definir para cada projeto se esse modelo é treinado com ativos do projeto ou com ativos de um catálogos de sua escolha.
Designações com base em classe de dados: Os termos são designados com base na designação da classe de dados para uma coluna. A vinculação adequada entre classes de dados e termos é um pré-requisito para resultados de qualidade aqui.
Correspondência de nome: os termos são designados com base na semelhança entre um termo e o nome do ativo ou coluna.
Tarefa de atribuição de termos baseada em IA geral : termos comerciais específicos do domínio são atribuídos e sugeridos por meio do modelo de base configurado. O modelo leva em conta nomes e descrições de ativos e colunas e corresponde semanticamente termos com esses metadados. Assim, os termos podem ser designados mesmo se eles não forem correspondências exatas
Dica: As pontuações de confiança desse método geralmente são menores do que as dos outros métodos. Portanto, reduza o limite de sugestões para um valor na faixa de 65% a 70% para que os termos retornados pelo método de atribuição de termos baseado em IA gen sejam considerados para atribuição de termos.Atribuição de termos com base em regras : os termos de negócios são atribuídos com base nas regras definidas no arquivo de regra de atribuição de termos ( CSV ) do projeto.
Deve existir no projeto um arquivo de regras válido
ikc-term-assignment-rules.csvno formato CSV. Se esse arquivo não existir no projeto, essa opção será ignorada. Se os arquivos existirem, mas tiverem um formato inválido, o enriquecimento de metadados falhará. Para obter mais informações, consulte o arquivo CSV sobre a atribuição de prazos com base em regras.
Por padrão, as pontuações de confiança que são retornadas pelos métodos de designação de termo selecionados são ajustadas com base em rejeições de termo anteriores, o que afeta a pontuação de confiança geral.
Se você não desejar que as rejeições de termo afetem a pontuação de confiança, será possível desativar essa opção
É possível ativar ou desativar a opção independentemente de quais métodos de designação de termo você selecionar. O escopo de treinamento configurado se aplica ao modelo para designação de termo e ao modelo para ajustar a pontuação de confiança.
Use métodos individuais para testar e avaliar designações de termo, por exemplo, quando você tem um grande conjunto de classes de dados personalizadas. Desta forma, também pode-se descobrir as configurações de limite adequadas para o seu projeto.
Você também pode utilizar as opções de ajuste fornecidas para influenciar a precisão e a cobertura das atribuições de termos. Consulte as opções de ajuste para a atribuição de termos.
Designação de classificação
Determine se as classificações também são atribuídas quando uma classe de dados ou um termo relacionado é automaticamente atribuído a um ativo de dados ou a uma coluna. Você pode configurar isso individualmente para classes de dados e termos.
Para projetos que foram criados antes de 23 de agosto de 2024, a atribuição automática de classificação é desativada por padrão.
Configurações avançadas de criação de perfil
Essas configurações se aplicarão à criação de perfil de dados avançados se um usuário ativar a opção Saída externa e puder ser sobrescrito para cada execução individual
Determine se todos os valores distintos ou um número máximo dos valores distintos mais frequentes são capturados para cada coluna.. A configuração padrão é capturar os 1.000 valores distintos mais frequentes. Os dados são sobrescritos para cada execução de perfil avançado.
Defina o local de saída padrão para armazenar os valores capturados:
- Selecione uma conexão.
- Dependendo da conexão selecionada, selecione um esquema e uma tabela, ou selecione um catálogo, um esquema e uma tabela. Você pode selecionar catálogos, esquemas e tabelas existentes. Também é possível criar uma nova tabela em um esquema existente.
Para obter informações sobre quais origens de dados são suportadas como destino de saída, consulte a coluna Tabelas de saída em Origens de dados suportadas. Os nomes de esquema e tabela devem seguir esta convenção:
- O primeiro caractere para o nome deve ser um caractere alfabético
- O resto do nome pode consistir em caracteres alfabéticos, caracteres numéricos ou sublinhados.
- O nome não deve conter espaços.
Origens da verificação da qualidade dos dados
Selecione as origens das verificações de qualidade dos dados gerados:
- Resultados do perfilamento
- Restrições de prazo comercial
- Relacionamentos-chave
Verificações da qualidade dos dados a serem identificadas
Selecione os tipos de verificações de qualidade de dados a serem identificados quando o enriquecimento de metadados for configurado com essa opção de enriquecimento. Por padrão, todas as verificações disponíveis são selecionadas.
Para obter mais informações sobre essas verificações de qualidade de dados, consulte Tipos disponíveis de verificações de qualidade de dados.
Coletar dados históricos
Selecione se deseja armazenar os resultados da criação de perfil para cada ativo enriquecido por um determinado período, para que a estabilidade e a consistência dos dados possam ser avaliadas. Quando você definir um período de retenção para esses dados, considere a quantidade de dados que podem ser armazenados.
Se você desativar essa opção, as verificações de estabilidade histórica não retornarão resultados úteis.
Para comparar as contagens de linhas, a contagem total de linhas, aproximada ou real, é necessária. Essas informações podem não estar disponíveis para todas as fontes de dados. Além disso, a recuperação de uma contagem de registros total precisa deve ser explicitamente ativada no nível do sistema, pois é uma operação cara.
Saída de qualidade de dados
Configure o local de saída padrão para armazenar exceções de qualidade de dados e determine o número máximo de registros de exceções por verificação de qualidade de dados A gravação de exceções de qualidade de dados em uma tabela de banco de dados deve estar ativada no ativo de enriquecimento de metadados
- Número máximo de registros de saída de exceção
Determine quantos problemas por coluna são gravados na tabela de saída no máximo para cada verificação de qualidade de dados.. A configuração padrão é 100.
- Local de saída
Defina as tabelas de saída padrão para armazenar exceções de qualidade de dados:
- Selecione uma conexão.
- Dependendo da conexão selecionada, selecione um esquema e uma tabela ou selecione um catálogo, um esquema e uma tabela para armazenar as exceções.
- Opcionalmente, selecione uma tabela para armazenar as linhas inteiras nas quais os problemas foram encontrados (registros de exceção). Você pode selecionar uma tabela existente no esquema em que a tabela de exceções é criada ou criar uma nova tabela nesse esquema.
É possível selecionar entre esquemas e tabelas existentes ou criar novas tabelas em um esquema existente. Para obter informações sobre quais origens de dados são suportadas como destino de saída, consulte a coluna Tabelas de saída em Origens de dados suportadas. Os nomes de esquema e tabela devem seguir esta convenção:
- O primeiro caractere para o nome deve ser um caractere alfabético
- O resto do nome pode consistir em caracteres alfabéticos, caracteres numéricos ou sublinhados.
- O nome não deve conter espaços.
Para criar uma nova tabela para a saída, insira um nome em vez de selecionar nas tabelas disponíveis. Observe que o nome da tabela não deve conter caracteres especiais.
Para armazenar apenas os problemas de qualidade, uma nova tabela é criada com as seguintes definições de coluna:
asset_id VARCHAR(40), issue_type VARCHAR(64), column1 VARCHAR(128), value1 VARCHAR(64), column2 VARCHAR(128), value2 VARCHAR(64)Para armazenar os problemas de qualidade e os registros de exceção, uma nova tabela para os problemas de qualidade é criada com estas definições de coluna:
asset_id VARCHAR(40), issue_type VARCHAR(64), column VARCHAR(128), row_id VARCHAR(64)Uma nova tabela para armazenar os registros de exceção é criada com estas definições de colunas:
asset_id VARCHAR(40), row_id VARCHAR(64), row_data CLOBSe você selecionar uma tabela existente para qualquer tipo de saída, a tabela selecionada deverá ter a estrutura apropriada para a saída desejada.
Se a conexão estiver bloqueada, será solicitado que você insira suas credenciais pessoais Essa é uma etapa única que desbloqueia permanentemente a conexão para você.
Relacionamentos-chave
Um relacionamento de chave consiste em uma chave primária e estrangeira e define um relacionamento entre dois ativos de dados em um banco de dados relacional..
- Limite de sugestão
Define a confiança mínima necessária para os relacionamentos entre chaves primárias e estrangeiras a serem sugeridos A configuração padrão é de 80%
Esse limite é aplicado ao executar uma análise de relacionamento de chave básica; ele não é aplicado à análise de relacionamento de chave detalhada ou análise de sobreposição. É possível configurar limites de sugestão para esses tipos de análise para cada execução individual..
Para que os relacionamentos sejam atribuídos automaticamente, selecione a opção Atribuir automaticamente opção e definir um limite de atribuição.
- Limite de designação
Define a confiança mínima necessária para que os relacionamentos entre chaves primárias e estrangeiras sejam atribuídos automaticamente. A configuração padrão é 90%.
Quando um relacionamento de chave é atribuído automaticamente, a chave primária correspondente em um ativo pai também é atribuída automaticamente. No entanto, um ativo de dados não pode ter mais de uma chave primária atribuída. Portanto, apenas um relacionamento poderá ser atribuído se vários relacionamentos de chave com diferentes chaves primárias forem detectados para um ativo. O candidato de relacionamento com a pontuação de confiança mais alta é atribuído. Esta pontuação de confiança é calculada com base na pontuação de confiança da análise de chave primária. Se todos os candidatos a relacionamento tiverem a mesma pontuação de confiança, nenhum deles será atribuído.
Essas configurações são aplicadas quando você executa uma análise básica de relacionamento de chaves. Eles não são aplicados à análise aprofundada de relacionamentos importantes ou à análise de sobreposição. Para esses tipos de análise, você pode ativar a atribuição automática de relacionamentos e definir um limite de atribuição para cada execução individual.