Melhores práticas para atribuição de termos
Você pode seguir estas práticas recomendadas para melhorar a precisão e a eficiência dos resultados da atribuição de termos em watsonx.data intelligenceIBM.
Você pode selecionar aplicar todos ou um subconjunto desses métodos de atribuição de termos no enriquecimento de metadados:
- Machine Learning atribuição de prazo com base em
- Atribuição de termos com base na classe de dados
- Atribuição de termos correspondentes ao nome
- Designação de termos com base em regras
Machine Learning atribuição de prazo com base em
Machine Learning A atribuição de termos baseada em ML (aprendizado de máquina) utiliza um modelo integrado que é treinado a partir de termos comerciais publicados e atribuições de termos revisadas. O modelo aprende com exemplos positivos e negativos e melhora continuamente com base no feedback dos usuários.
Quando usar
Use a atribuição de termos baseada em ML quando desejar que o sistema aprenda padrões automaticamente a partir de atribuições e rejeições revisadas. O modelo se adapta automaticamente às mudanças no vocabulário comercial e nos metadados dos ativos.
Melhores práticas
Considere as seguintes informações.
Tipos de tarefas nos dados de treinamento
O modelo para atribuição de termos baseado em ML é treinado em dois tipos de atribuições:
exemplos positivos
Atribuir um termo comercial a um ativo ou coluna ajuda o modelo de atribuição de termos baseado em ML a aprender como melhor atribuir termos comerciais no futuro. Os termos são atribuídos nestes casos:
- O serviço de atribuição de termos atribui automaticamente um termo se o limite de confiança definido for excedido. O limite de confiança é definido nas configurações de enriquecimento de metadados.
- Você atribui um termo que foi sugerido pelo serviço de atribuição de termos.
- Você seleciona e atribui um termo correto.
exemplos negativos
É igualmente importante rejeitar ou remover uma atribuição de termo quando ela estiver incorreta. As rejeições e remoções ajudam o modelo de atribuição de termos baseado em ML a evitar a atribuição de termos incorretos semelhantes em execuções futuras. Remova um termo usando o símbolo menos (-) ao lado do termo na guia Governança no painel lateral.

Escopo do treinamento – catálogo (recomendado)
O modelo para atribuição de termos baseado em ML é treinado com base nas atribuições disponíveis em um catálogo.
Crie um catálogo de treinamento dedicado para garantir um aprendizado consistente do modelo e reduzir o ruído.
Publique recursos cuidadosamente revisados no catálogo de treinamento para treinamento em ML. Evite publicar recursos de projetos incompletos ou experimentais no catálogo de treinamento.
Âmbito da formação – projeto
O modelo ML também pode ser treinado com base nas atribuições de um projeto usado para o enriquecimento de metadados. Apenas os ativos e colunas revisados contribuem para o treinamento. Certifique-se de que os ativos sejam marcados como revisados após a validação de suas atribuições de prazo.
Melhoria contínua do modelo
Os modelos de ML são retreinados automaticamente durante o enriquecimento de metadados quando novos termos ou atribuições revisadas estão disponíveis.
Um modelo treinado com base nas atribuições e rejeições em um catálogo é compartilhado entre todos os enriquecimentos de metadados que fazem referência a esse catálogo nas configurações de enriquecimento de metadados em Selecionar ativos usados para treinar o modelo integrado e para ajuste. O treinamento desse modelo pode ser acionado a partir de todos os enriquecimentos de metadados que utilizam o modelo do catálogo de treinamento. Portanto, se um usuário executar novamente um enriquecimento de metadados em um projeto mais antigo que usa o modelo do catálogo de treinamento, a atribuição de termos baseada em ML poderá gerar novas sugestões ou atribuições com base nas últimas atribuições e rejeições revisadas no catálogo de treinamento.
Para melhorar o modelo, publique regularmente os ativos revisados nos catálogos de treinamento.
Resolução de problemas
Recuperar detalhes do modelo a partir dos registros de tarefas de enriquecimento de metadados:

Se um termo não for atribuído pela atribuição de termos baseada em ML conforme o esperado, verifique se o modelo utilizado deve conter as informações sobre a atribuição rejeitada ou aceita com base na data em que o treinamento foi concluído, ou no número de atribuições de termos ou no número de rejeições de termos.
Atribuição de termos com base em classes de dados
Este método gera atribuições de termos com base nos resultados da atribuição de classes de dados. Se uma classe de dados for atribuída a uma coluna e essa classe de dados estiver vinculada a um ou mais termos comerciais, esses termos podem ser sugeridos ou atribuídos automaticamente. O nível de confiança da atribuição do termo reflete o nível de confiança da atribuição da classe de dados.
Para trabalhar com este método:
Criar e gerenciar classes de dados
- Crie classes de dados que representem com precisão os tipos de dados (por exemplo, endereço de e-mail, ID do cliente). Para obter mais informações, consulte Classes de dados.
- Revise e atualize as classes de dados periodicamente para garantir que elas reflitam os padrões comerciais atuais.
Vincule classes de dados a termos comerciais
- Edite cada classe de dados e vincule-a a um ou mais termos comerciais relevantes, adicionando os termos comerciais na seção Artefatos relacionados. Apenas os termos comerciais publicados podem ser vinculados e atribuídos.
- Analise essas ligações antes de executar o enriquecimento de metadados para garantir resultados de alta qualidade.
Atribuir termos com base em classes de dados
Quando o enriquecimento de metadados é executado, as atribuições de termos são geradas automaticamente se as classes de dados e os termos estiverem corretamente vinculados. O nível de confiança da atribuição do termo reflete a confiança da classe de dados.
Quando usar
Use esse método quando existirem classes de dados consistentes e elas estiverem devidamente vinculadas aos termos comerciais. As atribuições de termos podem ser (mas não precisam ser) feitas com base no conteúdo dos dados reais nas colunas.
Melhores práticas
Mantenha as classes de dados específicas e relevantes para o domínio.
Audite periodicamente as ligações entre classes de dados e termos comerciais para minimizar falsos positivos.
Atribuição de termos correspondentes ao nome
O método de correspondência de nomes baseia seus resultados na semelhança entre nomes de termos (ou abreviações comuns) e nomes de ativos de dados ou colunas.
Quando usar
Use a correspondência de nomes quando os nomes das colunas ou dos ativos seguirem convenções de nomenclatura consistentes e contiverem palavras-chave semelhantes a termos comerciais. A correspondência de nomes fornece uma base para sugestões de termos quando outros métodos, como atribuição de termos baseada em ML, classes de dados ou IA genérica, carecem de dados de treinamento, classes de dados configuradas adequadamente ou contexto, como arquivos de abreviações, nomes de exibição ou descrições.
Melhores práticas
Se a atribuição de termos por correspondência de nomes atribuir ou sugerir muito poucos ou muitos termos, você pode diminuir ou aumentar os valores para Limite de atribuição e Limite de sugestão nas configurações de enriquecimento de metadados.
Resolução de problemas
Problemas e limitações comuns:
Compreensão limitada do contexto: as descrições ou os valores dos dados não são analisados.
Falsos positivos: os termos podem ser atribuídos a ativos ou colunas se tiverem nomes semelhantes, mesmo que o termo obviamente não se encaixe. Por exemplo, o termo
Invoice Datepode ser atribuído a uma coluna chamadaInvoicing_Data.Sem correspondência semântica: os termos são perdidos quando a semelhança dos nomes é baixa, mas o significado está relacionado.
Atribuição de termos baseada em IA genérica
A atribuição de termos baseada em IA genérica utiliza um modelo básico IBM Slate aperfeiçoado para corresponder semanticamente termos comerciais a ativos e colunas com base em nomes e descrições.
Quando usar
Use este método para capturar relações semânticas se os metadados não tiverem sobreposição direta de palavras-chave ou se você quiser usar IA para atribuição de termos específicos do domínio.
Designação de termos com base em regras
Este método utiliza regras simples definidas em um arquivo ` CSV ` que é carregado no projeto.
Quando usar
Este método é adequado se for possível formular regras de correspondência simples com base em propriedades de metadados, como nome ou descrição. Por exemplo: se o nome da coluna contiver “endereço”, atribua o termo “Dados pessoais”.
Melhores práticas
Crie um arquivo ` CSV ` com o nome e o formato exigidos e envie-o para o projeto. Para obter mais informações, consulte o arquivo CSV sobre a atribuição de prazos com base em regras.
O método baseado em regras serve como uma alternativa leve aos modelos personalizados de aprendizado de máquina.
Expansão de metadados
Se os recursos de IA genérica estiverem habilitados em sua implantação, você poderá executar o enriquecimento de metadados com a opção de gerar um nome de exibição e uma descrição para ativos e colunas. Para obter mais informações, consulte Projetando o enriquecimento de metadados e o blog Enriqueça seus metadados usando tecnologia de IA generativa alimentada por modelos básicos da IBM watsonx.
Esses metadados adicionais são usados da seguinte forma:
A atribuição de termos de correspondência de nomes usa o nome de exibição gerado para a correspondência de similaridade de nomes.
A atribuição de termos baseada em IA genérica utiliza o nome de exibição gerado e qualquer descrição sugerida para a atribuição de termos.
Assim, os resultados da utilização da opção Expandir metadados no enriquecimento de metadados irão melhorar ainda mais os resultados da atribuição de termos quando forem utilizados os métodos de atribuição de termos baseados na correspondência de nomes e na IA genérica (individualmente ou em combinação).
Combinação de métodos de atribuição de termos e ajuste fino dos resultados
Na maioria dos casos, é vantajoso usar vários métodos de atribuição de termos em conjunto, pois cada método tem seus pontos fortes e fracos. Por exemplo, a correspondência de nomes pode falhar se os metadados não contiverem sobreposições diretas de palavras-chave, mas a atribuição de termos baseada em IA genérica pode lidar com esses casos de forma eficaz. No entanto, a atribuição de termos baseada em IA genérica pode não ser capaz de fazer uma atribuição se não conseguir estabelecer uma conexão, pois não sabe o que um nome de coluna ou abreviação significa. Em tais situações, um modelo de ML treinado pode ser capaz de estabelecer a conexão com base em padrões aprendidos em tarefas anteriores.
Além disso, você pode aplicar opções de ajuste fino para a atribuição de termos que funcionam melhor quando vários métodos são usados juntos. Para obter mais informações e práticas recomendadas sobre como ajustar esses parâmetros, consulte Opções de ajuste para atribuição de termos.