Sobre a mineração de texto

Hoje, uma quantidade cada vez maior de informações está sendo realizada em formatos não estruturados e semi-estruturados, como e-mails de clientes, notas de call center, respostas de pesquisa em aberto, feeds de notícias, formulários web, etc. Essa abundância de informações representa um problema para muitas organizações que se perguntam: Como podemos coletar, explorar e alavancar essas informações?

Mineração de texto é o processo de analisar coleções de materiais textuais para capturar os principais conceitos e temas e descobrir relacionamentos e tendências ocultos sem exigir que você saiba as palavras ou termos precisos que os autores usaram para expressar esses conceitos Embora eles sejam bastante diferentes, a mineração de texto às vezes é confundida com a recuperação de informações. Enquanto a recuperação precisa e o armazenamento de informações é um enorme desafio, a extração e o gerenciamento de conteúdo de qualidade, terminologia e relacionamentos contidos nas informações são processos cruciais e críticos.

Mineração de texto e de dados

Para cada artigo de texto, a mineração de texto baseada em linguístico retorna um índice de conceitos, bem como informações sobre esses conceitos Essas informações estruturadas e destiladas podem ser combinadas com outras fontes de dados para abordar questões como:

  • Quais conceitos ocorrem juntos?
  • A que mais eles estão ligados?
  • Quais categorias de nível superior podem ser feitas a partir das informações extraídas?
  • O que os conceitos ou categorias preveem?
  • Como os conceitos ou categorias preveem o comportamento?

Combinar a mineração de texto com a mineração de dados oferece maior insight do que está disponível a partir de dados estruturados ou não estruturados sozinhos. Esse processo geralmente inclui as etapas a seguir:

  1. Identificar o texto a ser extraído. Prepare o texto para a mineração Se o texto existir em vários arquivos, salve os arquivos em um único local Para bancos de dados, determine o campo contendo o texto.
  2. Meu texto e extraia dados estruturados. Aplique os algoritmos de mineração de texto para o texto de origem
  3. Construa modelos de conceito e de categoria. Identifique os principais conceitos e / ou crie categorias. O número de conceitos retornados dos dados não estruturados geralmente é muito grande. Identificar os melhores conceitos e categorias para pontuação.
  4. Analisar os dados estruturados. Empregue técnicas tradicionais de mineração de dados, como armazenamento em cluster, classificação e modelagem preditiva, para descobrir os relacionamentos entre os conceitos Mescle os conceitos extraídos com outros dados estruturados para prever comportamento futuro com base nos conceitos.

Análise de texto e categorização

A análise de texto, uma forma de análise qualitativa, é a extração de informações úteis do texto para que as ideias ou conceitos fundamentais contidos neste texto possam ser agrupados em um número apropriado de categorias. A análise de texto pode ser realizada em todos os tipos e comprimentos de texto, embora a abordagem da análise varie um pouco.

Registros ou documentos mais curtos são categorizados mais facilmente, uma vez que não são tão complexos e geralmente contêm menos palavras e respostas ambíguas. Por exemplo, com perguntas de pesquisa de opinião curtas e abertas, se pedirmos às pessoas que nomeiam suas três atividades de férias favoritas, talvez esperemos ver muitas respostas curtas, como ir à praia, visitar parques nacionaisou não fazer nada. Respostas mais longas e abertas, por outro lado, podem ser bastante complexas e muito longas, especialmente se os respondentes forem educados, motivados e tiverem tempo suficiente para preencher um questionário. Se pedirmos que as pessoas nos digam sobre suas convicções políticas em uma pesquisa ou tenham um feed de blog sobre política, podemos esperar alguns comentários longos sobre todos os tipos de questões e posições.

A capacidade de extrair conceitos-chave e criar categorias perspicazes a partir dessas fontes de texto mais longas em um período muito curto de tempo é uma vantagem fundamental do uso do Text Analytics. Essa vantagem é obtida através da combinação de técnicas linguísticas e estatísticas automatizadas para produzir os resultados mais confiáveis para cada etapa do processo de análise de texto.

Processamento linguístico e PNL

O principal problema com o gerenciamento de todos esses dados de texto não estruturado é que não há regras padrão para escrever texto para que um computador possa entendê-lo. A linguagem, e consequentemente o significado, varia para cada documento e cada pedaço de texto. A única maneira de recuperar e organizar com precisão esses dados não estruturados é analisar a linguagem e, assim, descobrir seu significado. Existem várias abordagens automatizadas diferentes para a extração de conceitos de informações não estruturadas. Estas abordagens podem ser divididas em dois tipos, linguísticos e não linguísticos.

Algumas organizações tentaram empregar soluções não linguísticas automatizadas baseadas em estatísticas e redes neurais. Usando a tecnologia de computador, essas soluções podem escanear e categorizar conceitos-chave mais rapidamente do que os leitores humanos. Infelizmente, a precisão de tais soluções é bastante baixa. A maioria dos sistemas baseados em estatísticas simplesmente contam o número de vezes que palavras ocorrem e calculam sua proximidade estatística com conceitos relacionados. Eles produzem muitos resultados irrelevantes, ou ruído, e resultados de falta que deveriam ter encontrado, referidos como silêncio.

Para compensar sua precisão limitada, algumas soluções incorporam regras não linguísticas complexas que ajudam a distinguir entre resultados relevantes e irrelevantes. Isso é referido como mineração de texto baseada em regra

Mineração de texto baseada em linguística, por outro lado, aplica os princípios de processamento de linguagem natural (NLP)-a análise assistida por computador de idiomas humanos-à análise de palavras, frases e sintaxe, ou estrutura, de texto. Um sistema que incorpora NLP pode extrair conceitos de forma inteligente, incluindo frases compostas. Além disso, o conhecimento da linguagem subjacente permite a classificação de conceitos em grupos relacionados, como produtos, organizações ou pessoas, usando significado e contexto.

A mineração de texto baseada em linguística encontra significado no texto tanto quanto as pessoas-reconhecendo uma variedade de formas de palavras como tendo significados semelhantes e analisando a estrutura de frases para fornecer uma estrutura para entender o texto. Esta abordagem oferece a velocidade e a relação custo-eficácia dos sistemas baseados em estatísticas, mas oferece um grau muito mais elevado de precisão, exigindo uma intervenção muito menos humana.

Para ilustrar a diferença entre as abordagens baseadas em estatísticas e lingüísticas durante o processo de extração, considere como cada um responderia a uma consulta sobre reproduction of documents. Ambas as soluções baseadas em estatísticas e linguísticas teriam que expandir a palavra reproduction para incluir sinônimos, como copy e duplication. Caso contrário, informações relevantes serão ignoradas. Mas se uma solução baseada em estatísticas tentar fazer esse tipo de sinonímia-procurar outros termos com o mesmo significado-é provável que inclua o termo birth também, gerando vários resultados irrelevantes. A compreensão da linguagem corta a ambiguidade do texto, tornando a mineração de texto baseada em linguística, por definição, a abordagem mais confiável.

Entender como o processo de extração funciona pode ajudar a tomar decisões importantes ao ajustar seus recursos linguísticos (bibliotecas, tipos, sinônimos e mais). Etapas no processo de extração incluem:

  • Convertendo dados de origem para um formato padrão
  • Identificando termos candidatos
  • Identificando classes de equivalência e integração de sinônimos
  • Designando um tipo
  • Indexação e, quando solicitado, correspondência de padrões com um analisador secundário..

Etapa 1. Convertendo dados de origem em um formato padrão

Nesta primeira etapa, os dados importados são convertidos para um formato uniforme que pode ser usado para análise adicional. Essa conversão é executada internamente, e não altera seus dados originais

Etapa 2. Identificando termos candidatos

É importante compreender o papel dos recursos linguísticos na identificação de termos candidatos à extração linguística. Os recursos linguísticos são usados toda vez que uma extração é executada Eles existem na forma de modelos, bibliotecas e recursos compilados As bibliotecas incluem listas de palavras, relacionamentos e outras informações usadas para especificar ou ajustar a extração Os recursos compilados não podem ser visualizados ou editado No entanto, os recursos restantes podem ser editados no Editor de Template ou, se você estiver em uma sessão de Workbench do Text Analytics, no editor de Recursos.

Os recursos compilados são componentes internos principais do mecanismo de extração dentro do Text Analytics. Esses recursos incluem um dicionário geral contendo uma lista de formulários de base com um código de parte-de-fala (substantivo, verbo, adjetivo, etc).

Além desses recursos compilados, várias bibliotecas são entregues com o produto e podem ser usadas para complementar os tipos e definições de conceito nos recursos compilados, bem como para oferecer sinônimos. Essas bibliotecas-e quaisquer que você criar-são compostas de vários dicionários. Eles incluem dicionários de tipo, dicionários de sinônimos, e dicionários de exclusão.

Depois que os dados são importados e convertidos, o motor de extração começará a identificar os termos de candidato para extração. Termos candidatos são palavras ou grupos de palavras que são usados para identificar conceitos no texto. Durante o processamento do texto, palavras únicas (uniterms) e palavras compostas (multitermos) são identificadas usando extratores padrão de parte do discurso. Em seguida, as palavras-chave de opinião do candidato são identificadas usando análise de link de texto de sentimento.

Nota: Os termos no dicionário geral compilado acima mencionados representam uma lista de todas as palavras que provavelmente serão desinteressantes ou linguisticamente ambíguas como uniterms. Essas palavras são excluídas da extração quando você está identificando os uniterms.. No entanto, eles são reavaliados quando você está determinando partes da fala ou olhando para palavras compostas candidatas mais longas (multitermos).

Etapa 3. Identificando classes de equivalência e integração de sinônimos

Depois que uniterms e multitermos candidatos são identificados, o software usa um dicionário de normalização para identificar classes de equivalência. Uma classe de equivalência é uma forma base de uma frase ou uma forma única de duas variantes da mesma frase.O propósito de designar frases a classes de equivalências é assegurar que, por exemplo, side effect e 副作用 não sejam tratados como conceitos separados. Para determinar qual conceito usar para a classe de equivalência-ou seja, se side effect ou 副作用 é usado como o termo principal- o mecanismo de extração aplica as regras a seguir na ordem listada:

  • O formulário especificado pelo usuário em uma biblioteca
  • A forma mais frequente, conforme definido por recursos pré-compilados

Etapa 4. Designando tipo

Em seguida, tipos são designados a conceitos extraídos. Um tipo é um agrupamento semântico de conceitos Ambos os recursos compilados e as bibliotecas são usados nesta etapa Os tipos incluem coisas como conceitos de nível superior, palavras positivas e negativas, nomes, locais, organizações e mais.

Os sistemas linguísticos são sensíveis ao conhecimento-quanto mais informações contidas em seus dicionários, maior a qualidade dos resultados. A modificação do conteúdo do dicionário, como definições de sinônimo, pode simplificar as informações resultantes. Este é geralmente um processo iterativo e é necessário para a recuperação de conceito precisa. NLP é um elemento principal do Text Analytics.