Sobre a mineração de texto

Hoje, uma quantidade cada vez maior de informações está sendo realizada em formatos não estruturados e semi-estruturados, como e-mails de clientes, notas de call center, respostas de pesquisa em aberto, feeds de notícias, formulários web, etc. Essa abundância de informações representa um problema para muitas organizações que se perguntam: Como podemos coletar, explorar e alavancar essas informações?

Mineração de texto é o processo de análise de coleções de materiais textuais para capturar os principais conceitos e temas e descobrir relacionamentos ocultos e tendências, sem exigir que você conheça as palavras ou termos exatos que os autores usaram para expressar tais conceitos. Embora elas sejam bastante diferentes, a mineração de texto às vezes é confundida com recuperação de informações. Embora a recuperação precisa e o armazenamento de informações seja um enorme desafio, a extração e o gerenciamento de conteúdo de qualidade, terminologia e relacionamentos contidos nas informações são processos essenciais e críticos.

Mineração de texto e mineração de dados

Para cada artigo de texto, a mineração de texto baseada em linguística retorna um índice de conceitos, bem como informações sobre tais conceitos. Estas informações extraída e estruturadas podem ser combinada com outras origens de dados para abordar questões como:

  • Quais conceitos ocorrem juntos?
  • Ao que mais eles são vinculados?
  • Quais categorias de nível superior podem ser criadas a partir das informações extraídas?
  • O que os conceitos ou as categorias preveem?
  • Como os conceitos ou as categorias preveem o comportamento?

Combinar a mineração de texto com a mineração de dados oferece um insight maior do que está disponível a partir dos dados estruturados ou desestruturados sozinhos. Esse processo normalmente inclui as etapas a seguir:

  1. Identifique o texto a ser minerado. Prepare o texto para mineração. Se o texto existir em diversos arquivos, salve os arquivos em um único local. Para bancos de dados, determine o campo contendo o texto.
  2. Minere o texto e extraia os dados estruturados. Aplique os algoritmos de mineração de texto no texto de origem.
  3. Construir modelos de conceito e categoria. Identifique os principais conceitos e/ou crie categorias. O número de conceitos retornados dos dados não estruturados geralmente é muito grande. Identifique os melhores conceitos e categorias para escoragem.
  4. Analise os dados estruturados. Utilize técnicas de mineração de dados tradicionais, tais como armazenamento em cluster, classificação e modelagem preditiva para descobrir relacionamentos entre os conceitos. Mescle os conceitos extraídos com outros dados estruturados para prever o comportamento futuro com base nos conceitos.

Análise e categorização de texto

A análise de texto, uma forma de análise qualitativa, é a extração de informações úteis do texto para que as idéias ou conceitos-chave contidos neste texto possam ser agrupados em um número apropriado de categorias. A análise de texto pode ser executada em todos os tipos e comprimentos de texto, embora a abordagem para a análise irá variar um pouco.

Registros ou documentos mais curtos são categorizados com mais facilidade, uma vez que não são tão complexos e geralmente contêm menos palavras e respostas ambíguas. Por exemplo, com perguntas de pesquisa de opinião curtas e em aberto, se solicitarmos que as pessoas citem suas três atividades de férias favoritas, podemos esperar ver muitas respostas curtas, como ir à praia, visitar parques nacionais ou fazer nada. Respostas em aberto mais longas, por outro lado, podem ser bastante complexas e muito alongadas, especialmente se os respondentes forem instruídos, motivados e tiverem tempo suficiente para preencher um questionário. Se solicitarmos às pessoas que nos informem sobre suas convicções políticas em uma pesquisa de opinião ou tivermos um feed de blog sobre política, podemos esperar alguns comentários alongados sobre todos os tipos de questões e posições.

A capacidade de extrair conceitos-chave e criar categorias perspicazes a partir dessas fontes de texto mais longas em um período muito curto de tempo é uma das principais vantagens do uso da Análise de texto. Essa vantagem é obtida através da combinação de técnicas linguísticas e estatísticas automatizadas para produzir os resultados mais confiáveis para cada estágio do processo de análise de texto.

Processamento linguístico e NLP

O problema principal com o gerenciamento de todos esses dados de texto não estruturados é que não há regras padrão para gravação de texto para que um computador possa compreendê-los. O texto e, consequentemente, o significado, varia para cada documento e cada parte do texto. A única maneira de recuperar e organizar os dados não estruturados com precisão é analisar o texto e, assim, descobrir o seu significado. Há várias abordagens automatizadas diferentes para a extração de conceitos a partir de informações não estruturadas. Essas abordagens podem ser divididos em dois tipos, linguístico e não linguístico.

Algumas organizações tentaram utilizar soluções não linguísticas automatizadas com base em estatísticas e redes neurais. Usando a tecnologia de computador, essas soluções podem varrer e categorizar conceitos principais mais rapidamente do que os leitores humanos podem. Infelizmente, a precisão de tais soluções é razoavelmente baixa. A maioria dos sistemas baseados em estatísticas simplesmente contam o número de vezes que as palavras ocorrem e calculam suas proximidade estatística com os conceitos relacionados. Eles produzem muitos resultados irrelevantes, ou ruído, e perdem os resultados que eles deveriam ter encontrado, referidos como silêncio.

Para compensar a sua precisão limitada, algumas soluções incorporam regras não linguísticas complexas que o ajudam a distinguir entre resultados relevantes e irrelevantes. Isso é referido como mineração de texto baseada em regra.

Mineração de texto baseada em linguística, por outro lado, aplica os princípios de processamento de idioma natural (NLP)– a análise assistida por computador das linguagens humanas - na análise de palavras, frases e sintaxe ou estrutura do texto. Um sistema que incorpora o NLP pode extrair conceitos de maneira inteligente, incluindo frases compostas. Além disso, o conhecimento do texto subjacente permite a classificação de conceitos em grupos relacionados, tais como produtos, organizações ou pessoas, usando o significado e o contexto.

A mineração de texto baseada em linguística localiza significado no texto muito como as pessoas fazem - reconhecendo uma variedade de formatos da palavra com significados semelhantes e analisando a estrutura da sentença para fornecer uma estrutura para o entendimento do texto. Esta abordagem oferece a velocidade e a efetividade em custo dos sistemas baseados em estatísticas, mas oferece um grau muito maior de precisão enquanto requer muito menos intervenção humana.

Para ilustrar a diferença entre as abordagens baseadas em estatísticas e lingüísticas durante o processo de extração, considere como cada um responderia a uma consulta sobre reproduction of documents. Ambas as soluções baseadas em estatística e linguística teriam que expandir a palavra reproduction para incluir sinônimos, tais como copy e duplication. Caso contrário, informações relevantes serão omitidas. Mas se uma solução baseada em estatísticas tenta fazer este tipo de sinonímia — procura por outros termos com o mesmo significado - é provável que ela também inclua o termo birth, gerando um número de resultados irrelevantes. O entendimento do idioma evita a ambiguidade do texto, tornando a mineração de textos baseada em linguística, por definição, a abordagem mais confiável.

Entender como o processo de extração funciona pode ajudá-lo a tomar decisões sobre quando usar o ajuste fino nos seus recursos linguísticos (bibliotecas, tipos, sinônimos e mais). Etapas no processo de extração incluem:

  • Conversão da origem de dados em um formato padrão
  • Identificação de termos candidatos
  • Identificação de classes de equivalência e integração de sinônimos
  • Designação de um tipo
  • Indexação e, quando solicitado, correspondência de padrões com um analisador secundário

Etapa 1. Convertendo dados de origem em um formato padrão

Nesta primeira etapa, os dados importados são convertidos para um formato uniforme que pode ser usado para análise adicional. Esta conversão é executada internamente e não muda seus dados originais.

Etapa 2. Identificando os termos candidatos

É importante entender o papel dos recursos linguísticos na identificação de termos candidatos durante a extração linguística. Recursos linguísticos são usados a cada vez que uma extração é executada. Eles existem no formato de modelos, bibliotecas e recursos compilados. As bibliotecas incluem listas de palavras, relacionamentos e outras informações usadas para especificar ou ajustar a extração. Os recursos compilados não podem ser visualizados ou editados. No entanto, os recursos restantes podem ser editados no Editor de Template ou, se você estiver em uma sessão de Workbench do Text Analytics, no editor de Recursos.

Os recursos compilados são os principais componentes internos do mecanismo de extração dentro da Análise de texto. Esses recursos incluem um dicionário geral contendo uma lista de formulários de base com um código de parte-de-fala (substantivo, verbo, adjetivo, etc).

Além desses recursos compilados, várias bibliotecas são entregues com o produto e podem ser usadas para complementar os tipos e as definições de conceito nos recursos compilados, bem como para oferecer sinônimos. Estas bibliotecas — e quaisquer umas criadas — são compostas de diversos dicionários. Estes incluem dicionários de tipos, dicionários de sinônimos e dicionários de exclusão.

Depois que os dados são importados e convertidos, o motor de extração começará a identificar os termos de candidato para extração. Os termos candidatos são palavras ou grupos de palavras que são usados para identificar conceitos no texto. Durante o processamento do texto, palavras únicas (unitermos) e palavras compostas (multitermos) são identificadas usando extratores de padrão de classe gramatical. Em seguida, as palavras-chave de opinião do candidato são identificadas usando análise de link de texto de sentimento.

Nota: Os termos no dicionário geral compilado acima mencionados representam uma lista de todas as palavras que provavelmente serão desinteressantes ou linguisticamente ambíguas como uniterms. Estas palavras são excluídas da extração quando você está identificando os unitermos. Entretanto, elas são reavaliadas quando você está determinando parte do discurso ou verificando palavras compostas candidatas (multitermos).

Etapa 3. Identificação de classes de equivalência e integração de sinônimos

Após os unitermos e multitermos candidatos serem identificados, o software usa um dicionário de normalização para identificar classes de equivalência. Uma classe de equivalência é uma forma base de uma frase ou uma forma única de duas variantes da mesma frase.O objetivo de atribuir frases a classes de equivalência é garantir que, por exemplo, side effect e 副作用 não sejam tratados como conceitos separados. Para determinar qual conceito usar para a classe de equivalência,ou seja, se side effect ou 副作用 é usado como o termo principal, o mecanismo de extração aplica as regras a seguir na ordem listada:

  • O formulário especificado do usuário em uma biblioteca.
  • O formulário mais frequente, conforme definido pelos recursos pré-compilados.

Etapa 4. Tipo de designação

A seguir, os tipos são designados para conceitos extraídos. Um tipo é um agrupamento semântico de conceitos. Ambos os recursos compilados e as bibliotecas são usados nesta etapa. Os tipos incluem coisas como conceitos de alto nível, palavras positivas e negativas, nomes, locais, organizações e mais.

Os sistemas linguísticos são sensíveis ao conhecimento — quanto mais informações estão contidas em seus dicionários, mais alta será a qualidade dos resultados. A modificação do conteúdo do dicionário, tais como definições de sinônimo, pode simplificar as informações resultantes. Esse geralmente é um processo iterativo e é necessário para a recuperação de conceito precisa. O NLP é um elemento central da Análise de Texto.