Como funciona a extração

Onde um campo Contínuo com armazenamento inteiro é alterado para Ordinal, o valor superior é expandido para incluir todos os valores inteiros até o valor superior. Esta abordagem oferece a velocidade e a efetividade em custo dos sistemas baseados em estatísticas. Mas, ela oferece um grau muito maior de precisão, enquanto requer muito menos intervenção humana. A análise de texto baseada em linguística é baseada no campo de estudo conhecido como processamento de linguagem natural, também conhecido como linguística computacional.

Entender como o processo de extração funciona pode ajudá-lo a tomar decisões sobre quando usar o ajuste fino nos seus recursos linguísticos (bibliotecas, tipos, sinônimos e mais). Etapas no processo de extração incluem:

  • Conversão da origem de dados em um formato padrão
  • Identificação de termos candidatos
  • Identificação de classes de equivalência e integração de sinônimos
  • Designação de um tipo
  • Indexação
  • Correspondência de extração de padrões e eventos

Etapa 1. Conversão da origem de dados em um formato padrão

Nesta primeira etapa, os dados importados são convertidos para um formato uniforme que pode ser usado para análise adicional. Esta conversão é executada internamente e não muda seus dados originais.

Etapa 2. Identificação de termos candidatos

É importante entender o papel dos recursos linguísticos na identificação de termos candidatos durante a extração linguística. Recursos linguísticos são usados a cada vez que uma extração é executada. Eles existem no formato de modelos, bibliotecas e recursos compilados. As bibliotecas incluem listas de palavras, relacionamentos e outras informações usadas para especificar ou ajustar a extração. Os recursos compilados não podem ser visualizados ou editados. No entanto, os recursos restantes (templates) podem ser editados no Editor de Template ou, se você estiver em uma sessão de Workbench do Text Analytics, na editora de Recursos.

Os recursos compilados são os principais componentes internos do mecanismo de extração. Estes recursos incluem um dicionário geral contendo uma lista de formas originais com um código de parte do discurso (substantivo, verbo, adjetivo, advérbio, particípio, coordenador, determinador ou preposição). Os recursos também incluem tipos integrados reservados usados para designar muitos termos extraídos para os tipos a seguir, <Location>, <Organization> ou <Person>.

Além desses recursos compilados, várias bibliotecas são fornecidas com o produto e podem ser usadas para complementar os tipos e as definições de conceito nos recursos compilados, bem como para oferecer outros tipos e sinônimos. Estas bibliotecas — e quaisquer umas criadas — são compostas de diversos dicionários. Esses incluem dicionários de tipos, dicionários de substituições (sinônimos e elementos opcionais) e dicionários de exclusão.

Depois que os dados são importados e convertidos, o motor de extração começará a identificar os termos de candidato para extração. Os termos candidatos são palavras ou grupos de palavras que são usados para identificar conceitos no texto. Durante o processamento do texto, as palavras únicas (uni-terms) que não estão nos recursos compilados são consideradas como extrações de termo candidato. Palavras compostos do candidato (multi-termos) são identificadas usando extrusores de padrão de fala. Por exemplo, o multi-termo sports car, que segue o padrão adjetivo noun part-of-speech, tem dois componentes. O multi-termo fast sports car, que segue o padrão adjetivo adjetivo adjetivo parte-de-fala, tem três componentes.

Nota: Os termos no dicionário geral compilado acima mencionados representam uma lista de todas as palavras que provavelmente serão desinteressantes ou linguisticamente ambíguas como uni-termos. Estas palavras são excluídas da extração quando você está identificando os uni-terms. No entanto, eles são reavaliados quando você está determinando partes de discurso ou olhando para palavras compostos mais longas do candidato (multi-termos).

Finalmente, um algoritmo especial é usada para manipular sequências de letras maiúsculas, tais como títulos de trabalho, de modo que esses padrões especiais possam ser extraídos.

Etapa 3. Identificação de classes de equivalência e integração de sinônimos

Depois de candidato uni-termos e multi-termos são identificados, o software usa um conjunto de algoritmos para compará-los e identificar classes de equivalência. Uma classe de equivalência é uma forma original de uma frase ou uma forma única de duas variantes da mesma frase. O objetivo de atribuir frases a classes de equivalência é garantir que, por exemplo, president of the company e company president não sejam tratados como conceitos separados. Para determinar qual conceito usar para a classe de equivalência — ou seja, se president of the company ou company president é usado como o termo principal, o mecanismo de extração aplica as regras a seguir na ordem listada:

  • O formulário especificado do usuário em uma biblioteca.
  • A forma mais frequente no corpo completo do texto.
  • A forma mais curta no corpo completo do texto (que geralmente corresponde à forma original).

Etapa 4. Tipo de designação

A seguir, os tipos são designados para conceitos extraídos. Um tipo é um agrupamento semântico de conceitos. Ambos os recursos compilados e as bibliotecas são usados nesta etapa. Os tipos incluem coisas como conceitos de alto nível, palavras positivas e negativas, nomes, locais, organizações e mais. Tipos adicionais podem ser definidos pelo usuário.

Etapa 5. Indexação

Todo o conjunto de registros ou documentos é indexado estabelecendo-se um indicador entre uma posição do texto e o termo representativo para cada classe de equivalência. Isto assume que todas as instâncias de forma flexionada de um conceito candidato são indexadas como uma forma original candidata. A frequência global é calculada para cada forma original.

Etapa 6. Correspondência de extração de padrões e eventos

A análise de texto pode descobrir não apenas tipos e conceitos, mas também relações entre eles. Vários algoritmos e bibliotecas estão disponíveis com esta ferramenta e fornecem a capacidade de extrair padrões de relacionamento entre tipos e conceitos. Eles são especialmente úteis ao tentar descobrir opiniões específicas (por exemplo, reações do produto) ou os links relacionais entre pessoas ou objetos (por exemplo, links entre grupos políticos ou genomas).