Ambiente de trabalho de análise de texto

Em um nó Mineração de Texto, é possível optar por iniciar a sessão do Ambiente de Trabalho de Analítica de Texto quando o fluxo for executado. O Text Analytics Workbench é uma sessão interativa na qual é possível explorar os resultados da extração e ajustar a configuração do nó Mineração de Texto.

Mineração de texto é um processo iterativo no qual os resultados da extração são revisados de acordo com o contexto dos dados de texto, ajustado para produzir novos resultados e, em seguida, reavaliados Ao executar o nó Mineração de Texto, o mecanismo de extração lê os dados de texto, identifica os conceitos relevantes e designa um tipo para cada um.

Quando o nó Text Mining terminar de ser executado, o Text Analytics Workbench será aberto para que você possa revisar os resultados da extração. O Text Analytics Workbench é organizado em guias. Em cada guia, você pode focar em diferentes áreas do processo de mineração de texto..

conceitos
Conceitos são palavras e frases importantes que foram identificadas e extraídas dos dados de texto. Eles também são referidos como resultados da extração. Esses conceitos são agrupados em tipos. É possível usar esses conceitos para explorar seus dados e criar suas categorias. É possível gerenciar os conceitos na guia Conceitos
Links de texto
É possível extrair padrões de seus dados de texto se você tiver regras de análise de link de texto (TLA) nos recursos linguísticos. Por exemplo, o seu modelo de recurso já possui algumas regras de TLA. Esses padrões podem ajudar a descobrir relacionamentos interessantes entre conceitos em seus dados. Também é possível usar esses padrões como descritores em suas categorias. É possível gerenciar esses padrões na guia Links de texto
Categorias
Usando descritores (como resultados da extração, padrões e regras) como uma definição, é possível criar manualmente ou automaticamente um conjunto de categorias. Os documentos e registros são designados a essas categorias com base em se eles contêm uma parte da definição de categoria É possível gerenciar categorias na guia Categorias ..
Recursos
O processo de extração depende de um conjunto de parâmetros e definições de recursos linguísticos para controlar como o texto é extraído e tratado. Você pode ajustar esses recursos linguísticos (como modelos e bibliotecas) na guia Editor de recursos.
Figura 1. Ambiente de trabalho de análise de texto
Ambiente de trabalho de análise de texto

Você pode usar o workbench para realizar as seguintes tarefas de mineração de texto:

  • Extrair conceitos-chave de seus dados de texto
  • Construir categorias
  • Explore padrões na análise de link de texto (TLA)
  • Gerar nuggets do modelo de categoria.
  • Salve os recursos que você ajustou ou usou durante o processo de extração como um pacote de análise de texto (TAP).