Designação de termo automático
Designação automática de termo é o processo de mapeamento automático de termos de negócios para ativos de dados e colunas de ativos como parte do enriquecimento de metadados.
Além de quaisquer termos de negócios designados automaticamente, também é possível designar termos manualmente editando as propriedades do ativo de dados em um projeto ou catálogo ou quando você trabalha com resultados de enriquecimento.
Se a designação automática de termo for configurada como parte de enriquecimento de metadados, essas designações serão geradas pelos vários métodos Esses métodos também geram sugestões de termos para designar.
Os termos são designados com base no nível de confiança. Inicialmente, essas associações são representadas como candidatos que os especialistas de domínio e organizadores podem revisar e designar manualmente. A confiança para um termo designado ou sugerido é mostrada como um valor de porcentagem. Esse valor representa a confiança geral. Veja Como a confiança geral é computada. O nível de confiança para quando um termo é sugerido ou designado automaticamente é determinado pelas configurações de enriquecimento do projeto. O nível de confiança padrão a ser excedido é de 75% para sugestões de termo e de 90% para designação automática de termos candidatos. Consulte Configurações de enriquecimento padrão. Um administrador do projecto pode personalizar estas definições.
Somente termos de negócios publicados podem ser designados. Os termos designados não afetam a designação da classe de dados
Dependendo da configuração do termo, uma verificação da qualidade dos dados pode ser criada no enriquecimento de metadados para quaisquer ativos ou colunas de dados que tenham esse termo atribuído.
Qualidade de designações de termo
Para obter designações de termo de alta qualidade, considere as seguintes dicas:
Certifique-se de que as categorias que você deseja usar no enriquecimento de metadados incluam apenas artefatos de controle relevantes Talvez você já queira considerar isso ao configurar seu vocabulário de negócios
Experimente com os limites de designação de termo A mudança dos limites pode ter um impacto enorme no número de termos designados Localize o limite no qual o número de falsos positivos é baixo e não há muitos positivos verdadeiros ausentes..
Analise alguns dos falsos positivos para localizar um padrão ou uma razão válida pela qual esses termos foram sugeridos ou designados Se a maioria dos falsos positivos puderem ser atribuídos a um algoritmo específico, considere desativar esse algoritmo nas configurações de enriquecimento e executar novamente a designação de termo Verifique se isso reduz o número de falsos positivos.
Certifique-se de treinar o modelo ML em um catálogo no qual você publica apenas designações de termo cuidadosamente revisadas. De preferência, dedique um catálogo para modelar o treinamento.
Para a designação de termo com base nos dados ou metadados da coluna, crie relacionamentos entre termos e classes de dados Certifique-se de que as classes de dados usadas não produzam falsos positivos.
Métodos de designação de termo
É possível usar todos ou um subconjunto dos métodos de designação de termo disponíveis..
Correspondência de nome
O método de correspondência de nome baseia seu resultado na semelhança entre o nome do termo ou abreviações e o nome do ativo de dados ou coluna. Por exemplo, uma coluna CREDNUM pode ser associada a um termo Número do Cartão de Crédito devido à similaridade entre os dois nomes. A correspondência de nomes corresponde apenas aos nomes de ativos de dados e colunas com nomes de termos e abreviações, em que são considerados os nomes originais da fonte de dados e os nomes atribuídos gerados pela IA. As descrições não são consideradas. A designação de termo baseada em ML manipula nomes e descrições
Baseado na designação de classe de dados
O método de designação baseado em classe gera designações com base na classificação de dados Se uma classe de dados foi selecionada para uma coluna de ativo como resultado da análise de coluna ou manualmente e se essa classe de dados estiver vinculada a um ou mais termos de negócios, esses termos serão sugeridos ou designados se eles excederem os respectivos limites. O nível de confiança do termo é igual à confiança da classe de dados à qual o termo está vinculado. Por exemplo, uma coluna COL1 classificada como um endereço de e-mail com 90% de confiança, provavelmente será designada ao termo Endereço de e-mail se a classe de dados e o termo estiverem vinculados. Como não há similaridade entre o nome da coluna e o termo, o método de correspondência de nome não é capaz de fazer essa associação.
Para ativar o método de designação baseado em classe, é importante revisar a classe de dados para ligação de termo antes de executar a designação de termo porque a ligação apropriada é um pré-requisito importante para resultados de alta qualidade.
Machine learning
O método de aprendizado de máquina (ML) para geração de designações de termo utilizam os modelos de aprendizado de máquina supervisionada integrada. Esses modelos compreendem um modelo para designações de termo e um para remoções de termo.
Os modelos de ML são treinados com base nos termos publicados e nas designações de termo presentes nos dados de treinamento em um projeto ou catálogo. Veja Dados de treinamento para modelos de aprendizado de máquina. Se não estiverem disponíveis designações de termo, o treinamento para o modelo de designação de termo centra-se na similaridade linguística de palavras em nomes e descrições de termos e ativos de dados ou colunas. Os termos podem ser designados com base nessa similaridade. Com um número crescente de designações revisadas, os termos podem ser designados independentemente da similaridade linguística porque as designações de termos em colunas com características semelhantes se tornam disponíveis
Designação de termo baseada em IA generativa
Esse método usa um modelo de base IBM Slate ajustado para atribuir e sugerir termos comerciais específicos do domínio. O modelo considera nomes e descrições de ativos e colunas e corresponde semanticamente termos com esses metadados. Assim, os termos podem ser designados mesmo se eles não forem correspondências exatas
Designação de termos com base em regras
Este método utiliza regras definidas em um arquivo ` CSV ` no projeto. O nome do arquivo deve ser ikc-term-assignment-rules.csv. Para obter mais informações, consulte o arquivo CSV sobre a atribuição de prazos com base em regras.
Termos rejeitados
Ao revisar designações de termo nos resultados de enriquecimento de metadados, você pode localizar termos que você acha que não são precisos para um ativo de dados. É possível remover tais termos, fornecendo feedback negativo. Tais termos são considerados como rejeitados Se o escopo de treinamento for o projeto, as pontuações de confiança de designações de termo poderão ser ajustados com base nesses termos rejeitadas quando você executar novamente a designação de termo automático Os valores de confiança individuais retornados por cada método de designação de termo selecionado são ajustadas por esse valor de confiança negativo para calcular a pontuação de confiança geral de um termo... Consulte Como a pontuação de confiança geral é calculada.
Dados de treinamento para modelos de aprendizagem de máquina
Para cada projeto, é possível definir nas configurações de enriquecimento padrão se o modelo ML integrado usado para designação automática de termo é treinado com ativos do projeto ou com ativos de um catálogo de sua escolha. O ajuste das pontuações de confiança com base em rejeições estará disponível apenas se o escopo de treinamento for o projeto
A configuração padrão é treinar os modelos no projeto. Nesse caso, os modelos são treinados com quaisquer termos de negócios publicados e quaisquer designações ou rejeições de termo disponíveis em colunas que foram marcidas como revisadas no projeto
Ao selecionar um catálogo como o escopo de treinamento, o modelo para designações de termo é treinado com quaisquer termos de negócios publicados e quaisquer designações de termo disponíveis no catálogo selecionado. O modelo para rejeições de termo não pode ser treinado com ativos de um catálogo.
Quando os modelos são treinados?
O treinamento de modelo para os modelos ML integrados é acionado quando uma tarefa de enriquecimento de metadados é iniciada e uma destas condições é verdadeira:
Nenhum modelo está disponível ainda..
Um novo termo de negócios foi criado ou um termo existente foi atualizado desde o último treinamento do modelo. O termo não precisa ser designado a nenhum ativo ou coluna.
Projeto de escopo de treinamento: Pelo menos 21 colunas foram marcadas como revisadas desde que o modelo foi treinado pela última vez..
Catálogo do escopo de treinamento: Designações em pelo menos 21 colunas no catálogo selecionado mudaram porque os termos foram designados ou removidos desde que o modelo foi treinado pela última vez.
O último treinamento não foi concluído com sucesso ou dentro de um período razoável de tempo..
Se nenhuma informação sobre rejeições de termo estiver disponível no primeiro uso do modelo para ajustes de pontuação de confiança, o treinamento inicial para esse modelo acontecerá posteriormente, o que significa que ele será inicialmente treinado quando as informações sobre termos rejeitados estiverem disponíveis em um ciclo de treinamento de modelo subsequente..
Como a confiança geral é computada
Um método que associa um termo a um ativo de dados calcula uma confidence, que é um valor numérico entre um mínimo configurável e 1. O valor mínimo é definido pelo limite de sugestão para atribuição de termos que pode ser configurado nas configurações de enriquecimento padrão.
A confiança para um termo designado ou sugerido é mostrada como um valor de porcentagem. Esse valor representa a confiança geral. A confiança geral é o máximo dos valores de confiança retornados pelos métodos de designações de termo selecionados e pode ser ajustado por qualquer valor de confiança negativo retornado pelo modelo ML para remoções de termo
É possível escolher se os valores de confiança retornados pelos métodos de designação de termo selecionados são ajustados com base nos termos de negócios rejeitados anteriormente.
Exemplo:
Supondo que todos os métodos estejam ativados, os valores de confiança para uma coluna ENDEREÇO e termo Endereço Home:
Name matching: 0.5
Class-based assignment: 0.4
ML-based assignment: 0.3
Semantic assignment: 0.5
ML model for rejections: -0.4
O valor de confiança real para cada método é calculado subtraindo o valor de confiança retornado para termos rejeitados:
Name matching: 0.5 - 0.4 = 0.1
Class-based assignment: 0.4 - 0.4 = 0
ML-based assignment: 0.3 - 0.4 = -0.1
Semantic assignment: 0.5 - 0.4 = 0.1
A confiança geral é 0.1 porque é o valor mais alto calculado para um método.
Se o mesmo valor de confiança para um termo for calculado para vários métodos, apenas um será designado automaticamente.. A ordem em que tal termo é selecionado é a seguinte:
- Termo localizado pelo método de atribuição baseado em classe de dados
- Termo localizado pelo método semântico de designação de termos
- Termo encontrado pelo modelo ML incorporado
- Termo localizado pelo método name-matching
Como os novos resultados de análise atualizam as designações de termo existentes
Ao reexecutar um enriquecimento, um novo resultado de análise atualiza as designações de termo da forma a seguir:
| Tipo de designação de termo | O ativo ou coluna de dados é revisado | O ativo de dados ou coluna não foi revisado |
|---|---|---|
| Termos designados manualmente | Os prazos dos trabalhos continuam os mesmos. | Os prazos dos trabalhos continuam os mesmos. |
| Termos rejeitados | A lista de termos rejeitados permanece inalterada. | A lista de termos rejeitados permanece inalterada. |
| Termos Sugeridos | Os termos sugeridos são excluídos e substituídos pelos novos termos sugeridos. | Os termos sugeridos são excluídos e substituídos pelos novos termos sugeridos. |
| Termos designados automaticamente | As designações de termo existentes permanecem inalteradas. Os termos recém-detectados são incluídos como termos sugeridos | As atribuições de período existentes são substituídas. |