Mineração para conceitos e categorias

O nó Mineração de Texto usa técnicas linguísticas e de frequência para extrair conceitos-chave do texto e criar categorias com esses conceitos e outros dados. Use o nó para explorar o conteúdo dos dados de texto ou para produzir um nugget do modelo de conceito ou um nugget do modelo de categoria.

Nó de mineração de texto
Ao executar esse nó, um mecanismo de extração linguística interno extrai e organiza os conceitos, padrões e categorias usando métodos de processamento de linguagem natural.. Dois modos de construção estão disponíveis nas propriedades do nó Mining do Texto:
  • O modo Gerar diretamente (conceito modelo nugget) automaticamente produz um conceito ou modelo de categoria nugget quando você executa o nó.
  • O Build interativamente (nugget do modelo de categoria) é uma abordagem mais prática e exploratória É possível usar esse modo para não apenas extrair conceitos, criar categorias e refinar recursos linguísticos, mas também executar análise de link de texto e explorar clusters. Este modo de construção lança o Ambiente Analytics Workbench.

E é possível usar o nó Mineração de Texto para gerar um dos dois nuggets do modelo de mineração de texto:

  • Os nuggets do modelo de conceito descobrem e extraem conceitos importantes de seus dados de texto estruturados ou não estruturados.
  • Os nuggets do modelo de categoria pontuam e atribuem documentos e registros a categorias, que são formadas pelos conceitos (e padrões) extraídos.

Os conceitos e padrões extraídos e as categorias de seus nuggets de modelo podem ser todos combinados com dados estruturados existentes, como dados demográficos, para produzir decisões melhores e mais focadas. Por exemplo, se os clientes frequentemente listam problemas de login como o principal impedimento para concluir as tarefas de gerenciamento de conta online, você pode querer incorporar "problemas de login" em seus modelos.

Fontes de dados e recursos linguísticos

Os nós de mineração de texto aceitam dados de texto dos nós de importação.

Também é possível fazer upload de modelos customizados e pacotes de análise de texto diretamente no nó Mineração de Texto para usar no processo de extração.

Observação: O nó Text Mining pode extrair dados de texto escritos em chinês simplificado e chinês tradicional. No entanto, SPSS Modeler atualmente fornece modelos e pacotes de análise de texto apenas para chinês simplificado. Você precisa desenvolver modelos personalizados e pacotes de análise de texto para adaptá-los ao chinês tradicional.

Conceitos e nuggets do modelo de conceito

Durante o processo de extração, os dados de texto são varridos e analisados para identificar palavras únicas importantes, como election ou peacee frases de palavras como presidential election, election of the presidentou peace treaties. Essas palavras e frases são chamadas coletivamente de termos. Usando os recursos linguísticos, os termos relevantes são extraídos e termos semelhantes são agrupados sob um termo de oportunidade que é chamado de conceito.

Esse agrupamento significa que um conceito pode representar vários termos subjacentes Por exemplo, o conceito salary foi extraído de uma pesquisa de satisfação do funcionário. Ao verificar os registros associados a salary, você notou que salary nem sempre está presente no texto, mas, em vez disso, determinados registros continham algo semelhante, como os termos wage, wagese salaries. Estes termos são agrupados sob salary já que o mecanismo de extração os considerou como semelhantes ou determinou que eles eram sinônimos com base nas regras de processamento ou nos recursos linguísticos. Nesse caso, quaisquer documentos ou registros contendo qualquer um desses termos seriam tratados como se eles continam a palavra salary.

Se você quiser ver quais termos estão agrupados sob um conceito, você pode explorar o conceito no Ambiente de Trabalho de Analítica de Texto ou olhar para quais sinônimos são mostrados no modelo de conceito.

Um nugget do modelo de conceito contém um conjunto de conceitos que podem ser usados para identificar registros ou documentos que também contêm o conceito (incluindo qualquer um de seus sinônimos ou termos agrupados). Um modelo de conceito pode ser usado de duas maneiras:
  • Explorar e analisar os conceitos que foram descobertos no texto de origem original ou identificar rapidamente documentos de interesse.
  • Para aplicar esse modelo a novos registros de texto ou documentos para identificar rapidamente os mesmos conceitos chave nos novos documentos / registros. Por exemplo, é possível aplicar o modelo para a descoberta em tempo real de conceitos-chave em dados de bloco de rascunho de uma central de atendimento

Categorias e nuggets de modelo de categoria

É possível criar categorias que representam conceitos ou tópicos de nível superior para capturar as principais ideias, conhecimento e atitudes expressas no texto. As categorias são compostas por um conjunto de descritores, como conceitos, tipos e regras. Juntos, esses descritores são usados para identificar se um registro ou documento pertence a uma categoria. Um documento ou registro pode ser varrido para ver se alguma parte de seu texto corresponde a um descritor. Se uma correspondência for localizada, o documento será designado a essa categoria Esse processo é chamado de categorização.

Categorias podem ser construídas automaticamente usando o conjunto robusto de técnicas automatizadas do SPSS Modeler. Também é possível construí-los manualmente usando qualquer insight adicional que você possa ter sobre os dados ou uma combinação de ambos. Também é possível carregar um conjunto de categorias pré-construídas de um pacote de análise de texto por meio das configurações de modelo deste nó. A criação manual de categorias ou categorias de refino só pode ser feita por meio do Workbench de Analítica de Texto.

Um nugget do modelo de categoria contém um conjunto de categorias junto com seus descritores. O modelo pode ser utilizado para categorizar um conjunto de documentos ou registros com base no texto de cada documento ou registro. Cada documento ou registro é lido e, em seguida, designado a cada categoria para a qual uma correspondência do descritor foi localizada. Dessa forma, um documento ou registro poderia ser designado a mais de uma categoria. Por exemplo, é possível usar nuggets do modelo de categoria para ver as ideias essenciais em respostas de pesquisa de opinião abertas ou em um conjunto de entradas de blog