Como funciona a extração
Onde um campo Contínuo com armazenamento inteiro é alterado para Ordinal, o valor superior é expandido para incluir todos os valores inteiros até o valor superior. Esta abordagem oferece a velocidade e a efetividade em custo dos sistemas baseados em estatísticas. Mas, ela oferece um grau muito maior de precisão, enquanto requer muito menos intervenção humana. A análise de texto baseada em linguística é baseada no campo de estudo conhecido como processamento de linguagem natural, também conhecido como linguística computacional.
Entender como o processo de extração funciona pode ajudá-lo a tomar decisões sobre quando usar o ajuste fino nos seus recursos linguísticos (bibliotecas, tipos, sinônimos e mais). Etapas no processo de extração incluem:
- Conversão da origem de dados em um formato padrão
- Identificação de termos candidatos
- Identificação de classes de equivalência e integração de sinônimos
- Designação de um tipo
- Indexação
- Correspondência de extração de padrões e eventos
Etapa 1. Conversão da origem de dados em um formato padrão
Nesta primeira etapa, os dados importados são convertidos para um formato uniforme que pode ser usado para análise adicional. Esta conversão é executada internamente e não muda seus dados originais.
Etapa 2. Identificação de termos candidatos
É importante entender o papel dos recursos linguísticos na identificação de termos candidatos durante a extração linguística. Recursos linguísticos são usados a cada vez que uma extração é executada. Eles existem no formato de modelos, bibliotecas e recursos compilados. As bibliotecas incluem listas de palavras, relacionamentos e outras informações usadas para especificar ou ajustar a extração. Os recursos compilados não podem ser visualizados ou editados. No entanto, os recursos restantes (templates) podem ser editados no Editor de Template ou, se você estiver em uma sessão de Workbench do Text Analytics, na editora de Recursos.
Os recursos compilados são os principais componentes internos do mecanismo de extração. Estes recursos incluem um dicionário geral contendo uma lista de formas originais com um
código de parte do discurso (substantivo, verbo, adjetivo, advérbio, particípio, coordenador,
determinador ou preposição). Os recursos também incluem tipos integrados reservados usados
para designar muitos termos extraídos para os tipos a seguir, <Location>,
<Organization> ou <Person>.
Além desses recursos compilados, várias bibliotecas são fornecidas com o produto e podem ser usadas para complementar os tipos e as definições de conceito nos recursos compilados, bem como para oferecer outros tipos e sinônimos. Estas bibliotecas — e quaisquer umas criadas — são compostas de diversos dicionários. Esses incluem dicionários de tipos, dicionários de substituições (sinônimos e elementos opcionais) e dicionários de exclusão.
Depois que os dados são importados e convertidos, o motor de extração começará a identificar os termos de candidato para extração. Os termos candidatos são palavras ou
grupos de palavras que são usados para identificar conceitos no texto. Durante o processamento do texto, as palavras únicas (uni-terms) que não estão nos recursos compilados são consideradas como extrações de termo candidato. Palavras compostos do candidato (multi-termos) são identificadas usando extrusores de padrão de fala. Por exemplo, o multi-termo sports car, que segue o padrão adjetivo noun part-of-speech, tem dois componentes. O multi-termo fast
sports car, que segue o padrão adjetivo adjetivo adjetivo parte-de-fala, tem três componentes.
Finalmente, um algoritmo especial é usada para manipular sequências de letras maiúsculas, tais como títulos de trabalho, de modo que esses padrões especiais possam ser extraídos.
Etapa 3. Identificação de classes de equivalência e integração de sinônimos
Depois de candidato uni-termos e multi-termos são identificados, o software usa um conjunto de algoritmos para compará-los e identificar classes de equivalência. Uma classe de equivalência
é uma forma original de uma frase ou uma forma única de duas variantes da mesma frase. O objetivo de atribuir frases a classes de equivalência é garantir que, por exemplo, president of the
company e company president não sejam tratados como conceitos separados. Para determinar qual conceito usar para a classe de
equivalência — ou seja, se president of the
company ou company president é usado como o termo principal,
o mecanismo de extração aplica as regras a seguir na ordem listada:
- O formulário especificado do usuário em uma biblioteca.
- A forma mais frequente no corpo completo do texto.
- A forma mais curta no corpo completo do texto (que geralmente corresponde à forma original).
Etapa 4. Tipo de designação
A seguir, os tipos são designados para conceitos extraídos. Um tipo é um agrupamento semântico de conceitos. Ambos os recursos compilados e as bibliotecas são usados nesta etapa. Os tipos incluem coisas como conceitos de alto nível, palavras positivas e negativas, nomes, locais, organizações e mais. Tipos adicionais podem ser definidos pelo usuário.
Etapa 5. Indexação
Todo o conjunto de registros ou documentos é indexado estabelecendo-se um indicador entre uma posição do texto e o termo representativo para cada classe de equivalência. Isto assume que todas as instâncias de forma flexionada de um conceito candidato são indexadas como uma forma original candidata. A frequência global é calculada para cada forma original.
Etapa 6. Correspondência de extração de padrões e eventos
A análise de texto pode descobrir não apenas tipos e conceitos, mas também relações entre eles. Vários algoritmos e bibliotecas estão disponíveis com esta ferramenta e fornecem a capacidade de extrair padrões de relacionamento entre tipos e conceitos. Eles são especialmente úteis ao tentar descobrir opiniões específicas (por exemplo, reações do produto) ou os links relacionais entre pessoas ou objetos (por exemplo, links entre grupos políticos ou genomas).