Configurações linguísticas avançadas

Ao construir categorias, é possível selecionar a partir de diversas técnicas avançadas de construção de categoria linguística como inclusão de conceito e redes semânticas (apenas texto em inglês). Estas técnicas podem ser usadas individualmente ou em combinação entre si para criar categorias.

Tenha em mente que, porque cada conjunto de dados é exclusivo, o número de métodos e a ordem na qual você os aplica pode mudar ao longo do tempo. Como seus objetivos de mineração de texto podem ser diferentes de um conjunto de dados para o próximo, pode ser necessário experimentar com diferentes técnicas para ver qual produz os melhores resultados para os determinados dados de texto. Nenhuma das técnicas automáticas categorizará perfeitamente seus dados; portanto, recomendamos localizar e aplicar uma ou mais técnicas automáticas que funcionem bem com seus dados.

As configurações avançadas a seguir estão disponíveis para a opção Usar técnicas linguísticas para construir categorias nas configurações da categoria.

Entrada de categoria

Selecione quais serão as categorias que serão construídas a partir de:

  • Resultados de extração não usados. Essa opção possibilita que categorias sejam construídas a partir de resultados de extração que não são usados em quaisquer categorias existentes. Isso minimiza a tendência dos registros corresponderem diversas categorias e limita o número de categorias produzidas.
  • Todos os resultados da extração. Esta opção permite que as categorias sejam construídas usando qualquer um dos resultados da extração. Isso é mais útil quando nenhuma ou poucas categorias já existem.

Saída de categoria

Selecione a estrutura geral para as categorias que serão construídas:

  • Hierárquica com subcategorias. Esta opção cria subcategorias e sub-subcategorias. É possível configurar a profundidade de suas categorias, escolhendo o número máximo de níveis que podem ser criados. Por exemplo, se você escolher 3, as categorias poderiam conter subcategorias e essas subcategorias também poderiam ter subcategorias.
  • Categorias simples (apenas nível único). Esta opção constrói apenas um nível de categorias, significando que nenhuma subcategorias será gerada.

Técnicas de agrupamento

Cada uma das técnicas disponíveis é bem adequada a certos tipos de dados e situações, mas muitas vezes é útil combinar técnicas na mesma análise para capturar toda a gama de documentos ou registros. Você pode ver um conceito em diversas categorias ou localizar categorias redundantes.

  • Grupo por inclusão de conceito. Esta técnica constrói categorias agrupando conceitos multitermos (palavras compostas), dependendo se elas contêm palavras que são subconjuntos ou superconjuntos de uma palavra na outra. Por exemplo, o conceito seat seria agrupado com safety seat, seat belte seat belt buckle.
  • Grupo por rede semântica. Esta técnica começa identificando os possíveis sentidos de cada conceito abrangente a partir de seu índice extensivo de relacionamentos de palavras e, em seguida, cria categorias ao agrupar conceitos relacionados. Esta técnica é melhor quando os conceitos são conhecidos para a rede semântica e não são ambíguos. Ela é menos útil quando o texto contém terminologia especializada ou jargão desconhecido para a rede. Em um exemplo, o conceito granny smith apple poderia ser agrupado com gala apple e winesap apple já que eles são irmãos da graninha smith. Em outro exemplo, o conceito animal pode ser agrupado com cat e kangaroo já que eles são hiponyms de animal. Esta técnica está disponível apenas para texto em inglês.
  • Distância máxima de procura. Essa configuração só está disponível se você selecionar a opção Grupo por rede semântica. Selecione até onde você deseja que as técnicas procurem antes de produzir categorias. Quanto menor o valor, menos resultados você obterá - entretanto, esses resultados serão menos ruidosos e terão mais probabilidade de estarem significativamente vinculados ou associados entre si. Quanto mais alto o valor, mais resultados você pode obter - entretanto, esses resultados podem ser menos confiáveis ou relevantes. Embora esta opção seja globalmente aplicada em todas as técnicas, seu efeito é maior em coocorrências e redes semânticas.
  • Evitar emparelhamento de conceitos específicos. Assinale esta opção para interromper o processo de agrupar ou emparelhar dois conceitos juntos na saída. Para criar ou gerenciar pares de conceitos, clique em Gerenciar pares.
  • Generalizar com curingas sempre que possível. Selecione esta opção para permitir que o Modelador gere regras genéricas em categorias usando o curinga asterisco. Por exemplo, em vez de produzir vários descritores como [apple tart + .] e [apple sauce + .], usar curingas pode produzir [apple * + .]. Se você generalizar com curingas, muitas vezes você vai obter exatamente o mesmo número de registros ou documentos que você fez antes. Entretanto, esta opção tem a vantagem de reduzir o número e simplificar descritores de categoria. Além disso, essa opção aumenta a capacidade de categorizar mais registros ou documentos usando essas categorias em novos dados de texto (por exemplo, em estudos longitudinais/de ondas).

Outras opções para construção de categorias

Número máximo de categorias de nível superior criadas. Use esta opção para limitar o número de categorias que podem ser geradas na próxima vez que você clicar em Construir na área de janela de categorias. Em alguns casos, é possível obter melhores resultados ao configurar esse valor alto e, em seguida, excluir qualquer uma das categorias não interessantes.

Número mínimo de descritores e/ou subcategorias por descritor. Use esta opção para definir o número mínimo de descritores e subcategorias que uma categoria precisa conter para ser criada. Essa opção ajuda a limitar a criação de categorias que não capturam um número significativo de registros ou documentos.

Permitir que os descritores apareçam em mais de uma categoria. Quando selecionada, esta opção permite que os descritores sejam usados em mais de uma das categorias que serão construídas a seguir. Esta opção é geralmente selecionada porque os itens comumente ou "naturalmente" se enquadram em duas ou mais categorias, e permitir que eles façam isso geralmente leva a categorias de qualidade superior. Se você não selecionar essa opção, reduzirá a sobreposição de registros em várias categorias e - dependendo do tipo de dados que você possui - isso pode ser desejável. Entretanto, com a maioria dos tipos de dados, restringir descritores para uma única categoria geralmente resulta em uma perda de qualidade ou cobertura da categoria. Por exemplo, vamos dizer que você tem o conceito car seat manufacturer. Com esta opção, esse conceito poderia aparecer em uma categoria com base no texto car seat e em outra com base em manufacturer. Mas se essa opção não for selecionada, embora você ainda possa obter ambas as categorias, o conceito car seat manufacturer só aparecerá como um descritor na categoria ele melhor corresponde com base em vários fatores incluindo o número de registros em que car seat e manufacturer ocorrem cada um deles.

Resolver nomes de categoria duplicados por. Selecione como manipular quaisquer novas categorias ou subcategorias cujos nomes seriam os mesmos que os das categorias existentes. É possível mesclar os novos (e seus descritores) com as categorias existentes com o mesmo nome ou pode optar por ignorar a criação de quaisquer categorias se um nome duplicado for encontrado nas categorias existentes.