Guia do editor de recursos

A Análise de Texto captura de forma rápida e precisa os principais conceitos de dados de texto usando um processo de extração. Esse processo se baseia em recursos linguísticos para determinar como grandes quantidades de dados textuais não estruturados são analisados e interpretados.

Você pode usar a guia Resource editor para visualizar os recursos linguísticos que são usados no processo de extração. Esses recursos são armazenados na forma de modelos e bibliotecas, que são usados para extrair conceitos, agrupá-los em tipos, descobrir padrões nos dados de texto e outros processos.. O Text Analytics oferece vários modelos de recursos pré-configurados e, em alguns idiomas, também é possível usar os recursos em pacotes de análise de texto..

Na guia Editor de recursos, você trabalha com termos e tipos para identificar os conceitos a serem extraídos de um documento. Esses termos técnicos são definidos da seguinte forma.

conceitos
Conceitos são palavras e frases importantes que foram identificadas e extraídas dos dados de texto. Eles também são referidos como resultados da extração. Esses conceitos são agrupados em tipos. É possível usar esses conceitos para explorar seus dados e criar suas categorias.
Termos
Termos são as palavras específicas que compõem um conceito. Os termos são palavras únicas, como airport ou location, e frases de palavras, como airport pick-up. Elas são usadas para identificar conceitos no texto. Termos podem ser formas plurais ou singulares de palavras, partes de palavras maiores, sinônimos ou variações ortográficas.
Types
Tipos são agrupamentos semânticos para conceitos. Quando os conceitos são extraídos, eles são designados a um tipo para ajudar a agrupar conceitos semelhantes. Por exemplo, alguns dos tipos padrão são <Location>, <Organization>, <Person>, <Positive>e <Negative>.
Figura 1. Guia do editor de recursos
Guia do editor de recursos no Text Analytics Workbench

Você pode usar a guia Resource editor para personalizar e ajustar os recursos linguísticos. Também é possível usar os controles para gerenciar como termos são correspondidos com dados de texto e definir regras para análise de links de texto (TLA).

Área de janela termos / sinônimos

A área de janela Termos / sinônimos mostra todas as bibliotecas usadas como recursos linguísticos durante o processo de extração. Se desejar customizar como termos específicos são agrupados em conceitos, é possível editar os termos nas bibliotecas.. Também é possível incluir termos nas bibliotecas.. Por exemplo, se seus dados de texto forem específicos de um campo ou disciplina, será possível incluir quaisquer termos técnicos que possam estar ausentes

Bibliotecas e modelos customizados

Como esses recursos podem não se adequar perfeitamente ao contexto dos seus dados, você pode criar e gerenciar seus próprios recursos para um contexto ou domínio específico na guia Editor de recursos.

É possível salvar qualquer mudança que você fizer em uma biblioteca ou modelo como um ativo de projeto, que poderá ser reutilizado em outros fluxos. Também é possível importar bibliotecas ou modelos customizados caso você gerencie seus recursos usando arquivos locais.

Agrupamento difuso e agrupamento de inflexão

Você pode usar técnicas de agrupamento fuzzy e agrupamento de inflexão ao analisar dados de texto. A técnica de agrupamento fuzzy agrupa palavras com erros ortográficos comuns ou palavras com erros ortográficos próximos, e a técnica de agrupamento de inflexão agrupa variantes flexionadas de palavras com base na raiz.

Se você perceber que duas palavras com ortografia semelhante são agrupadas incorretamente quando você ativa esses recursos, poderá excluir as palavras dessas técnicas de agrupamento. É possível adicionar os pares incorretamente combinados à seção Exceptions (Exceções ) na guia Advanced resources (Recursos avançados).

Observação: você não pode usar as técnicas de agrupamento difuso e agrupamento de inflexão ao trabalhar com dados de texto escritos em chinês ou japonês. O agrupamento difuso funciona removendo vogais e consoantes duplas, que não existem nessas línguas. Da mesma forma, a técnica de agrupamento por inflexão não funciona de maneira eficaz, pois essas línguas não utilizam a inflexão para número e gênero da mesma forma que as línguas indo-europeias.