Configurando opções

É possível customizar diferentes partes do processo de extração enquanto no Text Analytics Workbench. Nas guias Conceitos, Links de textoe Categorias , é possível acessar várias configurações do ambiente de trabalho para alterar como os termos são extraídos dos dados de texto.

Configurações para resultados de extração

Ao executar o nó Mineração de Texto, o mecanismo de extração lê os dados de texto, identifica os conceitos relevantes e designa um tipo para cada um. É possível alterar as configurações para o processo de extração para ajustar como os resultados da extração são criados

Na guia Conceitos ou Links de texto , clique no ícone Configurações para alterar a configuração para extrair conceitos, padrões e links de texto

Ativar a extração de padrão de Análise de link de texto
Se você tiver regras de análise de link de texto (TLA) em uma de suas bibliotecas, marque a caixa de seleção para extrair padrões de TLA de seus dados de texto. Esta opção pode aumentar significativamente o tempo de extração
Limitar a extração a conceitos com uma frequência global de pelo menos
É possível usar essa opção para extrair um termo como um conceito somente se o termo aparecer um número configurado de vezes nos dados de texto
Acomodar erros de pontuação
Esta opção normaliza temporariamente o texto que possui erros de pontuação para melhorar a extração de conceitos durante o processo de extração Esta opção é útil quando um texto é curto e de má qualidade. Por exemplo, dados de texto de respostas de pesquisa de opinião abertas, e-mail e dados de CRM podem ter pontuação inadequada. Também é útil quando o texto contém muitas abreviações.
Acomodar ortografia para um limite mínimo de caractere raiz
Essa opção aplica uma técnica de agrupamento difuso que ajuda a agrupar palavras comumente digitadas incorretamente ou palavras escritas de perto sob um conceito. O algoritmo de agrupamento difuso remove temporariamente todas as vogais (exceto a primeira) e tira consoantes duplas / triplas das palavras extraídas. Em seguida, ele compara as palavras extraídas para ver se elas são iguais. Por exemplo,modelingemodellingsão agrupados juntos No entanto, se cada termo for atribuído a um tipo diferente, excluindo o<Unknown>, a técnica de agrupamento difuso não é aplicada.
Observação: você não pode usar as técnicas de agrupamento difuso e agrupamento de inflexão ao trabalhar com dados de texto escritos em chinês ou japonês. O agrupamento difuso funciona removendo vogais e consoantes duplas, que não existem nessas línguas. Da mesma forma, a técnica de agrupamento por inflexão não funciona de maneira eficaz, pois essas línguas não utilizam a inflexão para número e gênero da mesma forma que as línguas indo-europeias.
Extrair unitermos
É possível usar essa opção para extrair palavras únicas (uniterms) como conceitos quando elas atenderem aos seguintes critérios:
  • A palavra já não faz parte de uma palavra composta
  • A palavra é um substantivo ou uma parte não reconhecida do discurso
Extrair entidades não linguísticas
Essa opção extrai entidades não linguísticas, como as seguintes entidades:
  • Números de telefone
  • Números da Segurança Social
  • Tempos
  • Datas
  • Moedas
  • Porcentagens
  • Endereços de e-mail
  • HTTP endereços

É possível incluir ou excluir certos tipos de entidades não linguísticas. Desativando quaisquer entidades desnecessárias, o mecanismo de extração economiza tempo de processamento

Algoritmo de maiúscula
Esta opção extrai termos simples e compostos que não estão nos dicionários integrados, desde que a primeira letra do termo esteja em maiúscula. Essa opção pode ser útil se você quiser extrair os substantivos mais adequados.
Agrupar nomes pessoais parciais e completos quando possível
Essa opção agrupa nomes que aparecem de forma diferente no texto.. Esse recurso é útil já que os nomes são frequentemente referidos em sua forma completa no início do texto e, então, apenas por uma versão mais curta. Esta opção tenta corresponder qualquer unitermo com o tipo<Unknown> com a última palavra de qualquer um dos termos compostos que é digitado como <Person>. Por exemplo, se doe for localizado e inicialmente digitado como <Unknown>, o mecanismo de extração verifica se quaisquer termos compostos no tipo <Person> incluem doe como a última palavras, tal como john doe. Esta opção não se aplica aos primeiros nomes, pois a maioria nunca é extraída como unitermos.
Permutação máxima de palavras sem função
Esta opção especifica o número máximo de palavras sem função que pode estar presente ao aplicar a técnica de permutação. Esta técnica de permutação agrupa frases semelhantes que diferem umas das outras apenas pelas palavras não funcionais (por exemplo, of e the) contidas, independentemente da inflexão. Por exemplo, digamos que você configure esse valor para no máximo duas palavras e funcionários de empresa e funcionários da empresa tenham sido extraídos. Nesse caso, ambos os termos extraídos seriam agrupados na lista de conceito final já que ambos os termos são considerados o mesmo quando of the é ignorado.
Usar derivação ao agrupar termos compostos
Ao processar Big Data, selecione esta opção para agrupar multitermos usando regras de derivação.

Configurações para categorias

As categorias são construídas a partir de descritores derivados de tipos ou padrões de tipo. Na tabela, é possível selecionar os tipos individuais ou padrões de tipo para incluir no processo de construção de categoria.

Na guia Categorias, vá para Criar > Alterar configurações para alterar as seguintes configurações.

Construir categorias a partir de
Se você selecionar Tipos, as categorias serão construídas a partir dos conceitos que pertencem aos tipos selecionados Então, se você selecionar o<Budget>tipo na tabela, categorias comocostoupricepode ser produzido desdecostepricesão conceitos que são designados ao<Budget>tipo.

Por padrão, apenas os tipos que capturam a maioria dos registros ou documentos são selecionados. Esta pré-seleção permite que você foque rapidamente nos tipos mais interessantes e evite construir categorias desinteressantes. A tabela exibe os tipos em ordem decrescente começando por aquele com o maior número de registros ou documentos (Doc. contar).

A entrada escolhida afeta as categorias obtidas. Quando você escolhe usar Tipos como entrada, é possível ver os conceitos claramente relacionados mais facilmente. Por exemplo, se você construir categorias usando Tipos como entrada, poderá obter uma categoriaFruitcom conceitos comoapple,pear,citrus fruitseorange. Se você escolher Padrões de Tipo como entrada e selecionar o padrão<Unknown> + <Positive>, por exemplo, então você pode obter uma categoriafruit + <Positive>com um ou dois tipos de frutas comofruit + tastyeapple + good. Este segundo resultado só mostra 2 padrões de conceito porque as outras ocorrências de frutas não são necessariamente qualificados positivamente. Embora isso possa funcionar para seus dados de texto atuais, em estudos longitudinais em que você usa conjuntos de documentos diferentes, talvez você queira incluir manualmente outros descritores, comocitrus fruit + positiveou tipos de uso. Usar tipos sozinhos como uma entrada ajuda você a encontrar todas as frutas possíveis.

Se você selecionar Padrões de tipo, as categorias serão criadas a partir de padrões, em vez de tipos e conceitos próprios. Quaisquer registros ou documentos contendo um padrão de conceito que pertencem ao padrão de tipo selecionado são categorizados. Então, se você selecionar o<Budget>e<Positive>padrão de tipo na tabela, categorias comocost & <Positive>ourates & excellentpode ser produzido..

Ao usar padrões de tipo como entrada para construção de categoria automatizada, às vezes as técnicas identificam várias maneiras de formar a estrutura de categoria. Tecnicamente, não há uma única maneira certa de produzir as categorias; entretanto, você pode localizar uma estrutura mais adequada para sua análise do que outra. Para ajudar a customizar a saída neste caso, é possível designar um tipo como o foco preferencial. Todas as categorias de nível superior produzidas virão de um conceito do tipo que você selecionar aqui (e nenhum outro tipo). Cada subcategoria conterá um padrão de link de texto deste tipo. Escolha este tipo nas categorias Estrutura por tipo de padrão: campo e a tabela serão atualizados para mostrar apenas os padrões aplicáveis contendo o tipo selecionado. Mais frequentemente do que não,<Unknown>é pré-selecionado para você. Quando<Unknown>é selecionado, ele resulta em todos os padrões que contêm o tipo<Unknown>sendo selecionado. A tabela exibe os tipos em ordem decrescente, começando com aquele com o maior número de registros ou documentos (Doc. contar).

Técnicas
Como cada conjunto de dados é exclusivo, o número de métodos e a ordem na qual você os aplica podem ser alterados ao longo do tempo Seus objetivos para mineração de texto podem ser diferentes de um conjunto de dados para o próximo, portanto, pode ser necessário experimentar diferentes técnicas para ver quais produzem os melhores resultados com seus dados de texto.

Você não precisa ser um especialista nestas configurações para usá-las. Por padrão, as configurações médias mais comuns já estão selecionadas. Portanto, é possível efetuar bypass dos diálogos de configuração avançada e ir direto para a construção de suas categorias. Da mesma forma, se você fizer mudanças aqui, não é necessário voltar para o diálogo de configurações toda vez, já que as configurações mais recentes sempre são retidas.

Selecione uma das técnicas a seguir e, em seguida, clique em Configurações avançadas. Nenhuma das técnicas automáticas pode categorizar perfeitamente seus dados. Pode ser necessário localizar e aplicar uma ou mais técnicas automáticas que funcionem bem com seus dados Você não pode construir usando técnicas linguísticas e de frequência simultaneamente.

As configurações de Extensão a seguir estão disponíveis:

Entrada de categoria
Selecione Resultados de extração não usados se você desejar que as categorias sejam construídas a partir de resultados de extração que não são usados em nenhuma categoria existente Essa opção minimiza a tendência de registros corresponderem a diversas categorias e limita o número de categorias produzidas.. Ou selecione Todos os resultados da extração se você desejar que as categorias sejam construídas usando qualquer um dos resultados da extração Essa opção é mais útil quando você já tem algumas categorias.

Cada uma das técnicas de agrupamento ajusta-se melhor a determinados tipos de dados e situações Muitas vezes é útil combinar técnicas na mesma análise para capturar toda a gama de documentos ou registros. Você pode ver um conceito em várias categorias ou localizar categorias redundantes

A técnica de inclusão de conceito cria categorias agrupando conceitos de multitermos (palavras compostas) com base no fato de eles conterem palavras que são subconjuntos ou superconjuntos de uma palavra na outra. Por exemplo, o assento conceitual é agrupado com assento de segurança, cinto de segurança e fivela do cinto de segurança.

A técnica de rede semântica começa identificando os possíveis sentidos de cada conceito a partir de seu extenso índice de relações de palavras e, em seguida, cria categorias agrupando conceitos relacionados. Por exemplo, os conceitos scuba diving, sailing, snorkeling, kayakinge white water kayaking podem ser agrupados na categoria sports/sports by type/water sports. Ou o conceito animal pode ser agrupado com cat e kangaroo , pois eles são hipônimos de animais A técnica rede semântica funciona melhor quando os conceitos são conhecidos pela rede semântica e não são muito ambíguos. É menos útil quando o texto contém terminologia especializada ou jargão desconhecido para a rede. Esta técnica está disponível apenas para texto em inglês.

A opção Distância máxima de procura só está disponível se você selecionar a técnica de rede semântica. Selecione até onde você deseja que as técnicas sejam procuradas antes de produzir categorias. Quanto menor o valor, menos resultados você pode obter. No entanto, esses resultados são menos ruidosos e mais propensos a estarem significativamente ligados ou associados entre si. Quanto maior o valor, mais resultados você pode obter. No entanto, esses resultados podem ser menos confiáveis ou relevantes. Embora esta opção seja globalmente aplicada em todas as técnicas, seu efeito é maior em coocorrências e redes semânticas.

Selecione Evitar emparelhamento de conceitos específicos se desejar interromper o processo de agrupar ou emparelhar dois conceitos na saída. Para criar ou gerenciar pares de conceitos, clique em Gerenciar pares.

Onde possível
Escolha se deseja estender ou generalizar os descritores usando curingas ou ambos.
Ampliar e generalizar
Essa opção estende as categorias selecionadas e, então, generaliza os descritores. Ao escolher generalizar, o processo de construção de categoria cria regras de categoria genéricas que usam o curinga asterisco. Por exemplo, em vez de diversos descritores, como [apple tart + .] e [apple sauce + .], uma regra de categoria genérica pode usar curingas para produzir [apple * + .] Se você generalizar com curingas, muitas vezes você obtém o mesmo número de registros ou documentos como você fez antes. Entretanto, esta opção tem a vantagem de reduzir o número e simplificar descritores de categoria. Além disso, essa opção aumenta a capacidade de categorizar mais registros ou documentos usando essas categorias em novos dados de texto (por exemplo, em estudos longitudinais ou de onda)..
Ampliar somente
Esta opção estende suas categorias sem generalizar.. Pode ser útil escolher primeiro a opção Estender apenas para categorias criadas manualmente e, em seguida, estender as mesmas categorias novamente usando a opção Estender e generalizar .
Generalizar apenas
Esta opção generaliza os descritores sem estender suas categorias de qualquer outra maneira
Número máximo de itens pelos quais ampliar um descritor
Ao estender um descritor com itens (conceitos, tipos e outras expressões), defina o número máximo de itens que podem ser incluídos em um único descritor. Se você configurar esse limite para 10, não mais de 10 itens extras poderão ser incluídos em um descritor existente.. Se houver mais de 10 itens a serem incluídos, as técnicas param de incluir novos itens após o décimo ser incluído. Fazer isso pode tornar uma lista de descritores mais curta, mas não garante que os itens mais interessantes foram usados primeiro.
Ampliar também as subcategorias
Essa opção estende quaisquer subcategorias incluídas nas categorias selecionadas.
Ampliar categorias vazias com descritores gerados a partir do nome da categoria
Este método aplica-se apenas às categorias vazias, que possuem descritores 0. Se uma categoria já contiver descritores, ela não será estendida dessa maneira Esta opção tenta criar automaticamente descritores para cada categoria com base nas palavras que compõem o nome da categoria. O nome da categoria é verificado para ver se as palavras no nome correspondem a quaisquer conceitos extraídos. Se um conceito é reconhecido, ele é usado para encontrar padrões de conceito correspondentes e ambos são usados para formar descritores para a categoria. Esta opção produz os melhores resultados quando os nomes das categorias são ambos longos e descritivos. É um método rápido para gerar descritores de categoria, que por sua vez permitem que a categoria capture registros que contêm esses descritores. Esta opção é mais útil ao importar categorias de algum outro lugar ou ao criar categorias manualmente com nomes descritivos longos.
Gerar descritores como
Essa opção se aplicará apenas se a opção anterior for selecionada Escolha a opção Conceitos para produzir os descritores resultantes na forma de conceitos, independentemente de terem sido extraídos do texto de origem. Ou escolha a opção Padrões para produzir os descritores resultantes na forma de padrões, independentemente de os padrões resultantes ou quaisquer padrões terem sido extraídos.