Melhores práticas para atribuição de termos

Você pode seguir estas práticas recomendadas para melhorar a precisão e a eficiência dos resultados da atribuição de termos em watsonx.data intelligenceIBM.

Você pode selecionar aplicar todos ou um subconjunto desses métodos de atribuição de termos no enriquecimento de metadados:

Machine Learning atribuição de prazo com base em

Machine Learning A atribuição de termos baseada em ML (aprendizado de máquina) utiliza um modelo integrado que é treinado a partir de termos comerciais publicados e atribuições de termos revisadas. O modelo aprende com exemplos positivos e negativos e melhora continuamente com base no feedback dos usuários.

Quando usar

Use a atribuição de termos baseada em ML quando desejar que o sistema aprenda padrões automaticamente a partir de atribuições e rejeições revisadas. O modelo se adapta automaticamente às mudanças no vocabulário comercial e nos metadados dos ativos.

Melhores práticas

Considere as seguintes informações.

Tipos de tarefas nos dados de treinamento

O modelo para atribuição de termos baseado em ML é treinado em dois tipos de atribuições:

  • exemplos positivos

    Atribuir um termo comercial a um ativo ou coluna ajuda o modelo de atribuição de termos baseado em ML a aprender como melhor atribuir termos comerciais no futuro. Os termos são atribuídos nestes casos:

    • O serviço de atribuição de termos atribui automaticamente um termo se o limite de confiança definido for excedido. O limite de confiança é definido nas configurações de enriquecimento de metadados.
    • Você atribui um termo que foi sugerido pelo serviço de atribuição de termos.
    • Você seleciona e atribui um termo correto.
  • exemplos negativos

    É igualmente importante rejeitar ou remover uma atribuição de termo quando ela estiver incorreta. As rejeições e remoções ajudam o modelo de atribuição de termos baseado em ML a evitar a atribuição de termos incorretos semelhantes em execuções futuras. Remova um termo usando o símbolo menos (-) ao lado do termo na guia Governança no painel lateral.

    Captura de tela da guia Governança no painel lateral dos resultados do enriquecimento de metadados, onde você pode remover atribuições de termos

Âmbito da formação – projeto

O modelo ML também pode ser treinado com base nas atribuições de um projeto usado para o enriquecimento de metadados. Apenas os ativos e colunas revisados contribuem para o treinamento. Certifique-se de que os ativos sejam marcados como revisados após a validação de suas atribuições de prazo.

Melhoria contínua do modelo

Os modelos de ML são retreinados automaticamente durante o enriquecimento de metadados quando novos termos ou atribuições revisadas estão disponíveis.

Um modelo treinado com base nas atribuições e rejeições em um catálogo é compartilhado entre todos os enriquecimentos de metadados que fazem referência a esse catálogo nas configurações de enriquecimento de metadados em Selecionar ativos usados para treinar o modelo integrado e para ajuste. O treinamento desse modelo pode ser acionado a partir de todos os enriquecimentos de metadados que utilizam o modelo do catálogo de treinamento. Portanto, se um usuário executar novamente um enriquecimento de metadados em um projeto mais antigo que usa o modelo do catálogo de treinamento, a atribuição de termos baseada em ML poderá gerar novas sugestões ou atribuições com base nas últimas atribuições e rejeições revisadas no catálogo de treinamento.

Para melhorar o modelo, publique regularmente os ativos revisados nos catálogos de treinamento.

Resolução de problemas

Recuperar detalhes do modelo a partir dos registros de tarefas de enriquecimento de metadados:

Captura de tela de um registro de tarefas para enriquecimento de metadados com detalhes sobre o modelo de atribuição de termos utilizado

Se um termo não for atribuído pela atribuição de termos baseada em ML conforme o esperado, verifique se o modelo utilizado deve conter as informações sobre a atribuição rejeitada ou aceita com base na data em que o treinamento foi concluído, ou no número de atribuições de termos ou no número de rejeições de termos.

Atribuição de termos com base em classes de dados

Este método gera atribuições de termos com base nos resultados da atribuição de classes de dados. Se uma classe de dados for atribuída a uma coluna e essa classe de dados estiver vinculada a um ou mais termos comerciais, esses termos podem ser sugeridos ou atribuídos automaticamente. O nível de confiança da atribuição do termo reflete o nível de confiança da atribuição da classe de dados.

Para trabalhar com este método:

  1. Criar e gerenciar classes de dados

    • Crie classes de dados que representem com precisão os tipos de dados (por exemplo, endereço de e-mail, ID do cliente). Para obter mais informações, consulte Classes de dados.
    • Revise e atualize as classes de dados periodicamente para garantir que elas reflitam os padrões comerciais atuais.
  2. Vincule classes de dados a termos comerciais

    • Edite cada classe de dados e vincule-a a um ou mais termos comerciais relevantes, adicionando os termos comerciais na seção Artefatos relacionados. Apenas os termos comerciais publicados podem ser vinculados e atribuídos.
    • Analise essas ligações antes de executar o enriquecimento de metadados para garantir resultados de alta qualidade.
  3. Atribuir termos com base em classes de dados

    Quando o enriquecimento de metadados é executado, as atribuições de termos são geradas automaticamente se as classes de dados e os termos estiverem corretamente vinculados. O nível de confiança da atribuição do termo reflete a confiança da classe de dados.

Quando usar

Use esse método quando existirem classes de dados consistentes e elas estiverem devidamente vinculadas aos termos comerciais. As atribuições de termos podem ser (mas não precisam ser) feitas com base no conteúdo dos dados reais nas colunas.

Melhores práticas

Mantenha as classes de dados específicas e relevantes para o domínio.

Audite periodicamente as ligações entre classes de dados e termos comerciais para minimizar falsos positivos.

Atribuição de termos correspondentes ao nome

O método de correspondência de nomes baseia seus resultados na semelhança entre nomes de termos (ou abreviações comuns) e nomes de ativos de dados ou colunas.

Quando usar

Use a correspondência de nomes quando os nomes das colunas ou dos ativos seguirem convenções de nomenclatura consistentes e contiverem palavras-chave semelhantes a termos comerciais. A correspondência de nomes fornece uma base para sugestões de termos quando outros métodos, como atribuição de termos baseada em ML, classes de dados ou IA genérica, carecem de dados de treinamento, classes de dados configuradas adequadamente ou contexto, como arquivos de abreviações, nomes de exibição ou descrições.

Melhores práticas

Se a atribuição de termos por correspondência de nomes atribuir ou sugerir muito poucos ou muitos termos, você pode diminuir ou aumentar os valores para Limite de atribuição e Limite de sugestão nas configurações de enriquecimento de metadados.

Resolução de problemas

Problemas e limitações comuns:

  • Compreensão limitada do contexto: as descrições ou os valores dos dados não são analisados.

  • Falsos positivos: os termos podem ser atribuídos a ativos ou colunas se tiverem nomes semelhantes, mesmo que o termo obviamente não se encaixe. Por exemplo, o termo Invoice Date pode ser atribuído a uma coluna chamada Invoicing_Data.

  • Sem correspondência semântica: os termos são perdidos quando a semelhança dos nomes é baixa, mas o significado está relacionado.

Atribuição de termos baseada em IA genérica

A atribuição de termos baseada em IA genérica utiliza um modelo básico IBM Slate aperfeiçoado para corresponder semanticamente termos comerciais a ativos e colunas com base em nomes e descrições.

Quando usar

Use este método para capturar relações semânticas se os metadados não tiverem sobreposição direta de palavras-chave ou se você quiser usar IA para atribuição de termos específicos do domínio.

Designação de termos com base em regras

Este método utiliza regras simples definidas em um arquivo ` CSV ` que é carregado no projeto.

Quando usar

Este método é adequado se for possível formular regras de correspondência simples com base em propriedades de metadados, como nome ou descrição. Por exemplo: se o nome da coluna contiver “endereço”, atribua o termo “Dados pessoais”.

Melhores práticas

Crie um arquivo ` CSV ` com o nome e o formato exigidos e envie-o para o projeto. Para obter mais informações, consulte o arquivo CSV sobre a atribuição de prazos com base em regras.

O método baseado em regras serve como uma alternativa leve aos modelos personalizados de aprendizado de máquina.

Expansão de metadados

Se os recursos de IA genérica estiverem habilitados em sua implantação, você poderá executar o enriquecimento de metadados com a opção de gerar um nome de exibição e uma descrição para ativos e colunas. Para obter mais informações, consulte Projetando o enriquecimento de metadados e o blog Enriqueça seus metadados usando tecnologia de IA generativa alimentada por modelos básicos da IBM watsonx.

Esses metadados adicionais são usados da seguinte forma:

  • A atribuição de termos de correspondência de nomes usa o nome de exibição gerado para a correspondência de similaridade de nomes.

  • A atribuição de termos baseada em IA genérica utiliza o nome de exibição gerado e qualquer descrição sugerida para a atribuição de termos.

Assim, os resultados da utilização da opção Expandir metadados no enriquecimento de metadados irão melhorar ainda mais os resultados da atribuição de termos quando forem utilizados os métodos de atribuição de termos baseados na correspondência de nomes e na IA genérica (individualmente ou em combinação).

Combinação de métodos de atribuição de termos e ajuste fino dos resultados

Na maioria dos casos, é vantajoso usar vários métodos de atribuição de termos em conjunto, pois cada método tem seus pontos fortes e fracos. Por exemplo, a correspondência de nomes pode falhar se os metadados não contiverem sobreposições diretas de palavras-chave, mas a atribuição de termos baseada em IA genérica pode lidar com esses casos de forma eficaz. No entanto, a atribuição de termos baseada em IA genérica pode não ser capaz de fazer uma atribuição se não conseguir estabelecer uma conexão, pois não sabe o que um nome de coluna ou abreviação significa. Em tais situações, um modelo de ML treinado pode ser capaz de estabelecer a conexão com base em padrões aprendidos em tarefas anteriores.

Além disso, você pode aplicar opções de ajuste fino para a atribuição de termos que funcionam melhor quando vários métodos são usados juntos. Para obter mais informações e práticas recomendadas sobre como ajustar esses parâmetros, consulte Opções de ajuste para atribuição de termos.