Opções de especialistas

Com o nó de análise de link de texto (TLA), a extração de resultados de padrão de análise de link de texto é ativada automaticamente. Nas propriedades do nó, as opções de especialista incluem certos parâmetros adicionais que afetam como o texto é extraído e tratado. Os parâmetros de especialistas controlam o comportamento básico, bem como alguns comportamentos avançados, do processo de extração. Há também inúmeras opções e recursos linguísticos que também afetam os resultados da extração, os quais são controlados pelo modelo de recurso selecionado.

Limite a extração a conceitos com uma frequência global de pelo menos [n]. Esta opção especifica o número mínimo de vezes que uma palavra ou frase deve ocorrer no texto para que seja extraída. Dessa maneira, um valor de 5 limita a extração àquelas palavras ou frases que ocorrem pelo menos cinco vezes no conjunto inteiro de registros ou documentos.

Em alguns casos, a mudança desse limite pode fazer uma enorme diferença nos resultados da extração e, consequentemente, em suas categorias. Digamos que você esteja trabalhando com alguns dados do restaurante e não aumente o limite além de 1 para esta opção. Neste caso, você pode encontrar pizza (1), thin pizza (2), spinach pizza (2), e favorite pizza (2) em seus resultados de extração. Entretanto, se limitasse a extração a uma frequência global de 5 ou mais e refizesse a extração, você não obteria mais três desses conceitos. Em vez disso você obteria pizza (7), já que pizza é a forma mais simples e esta palavra já existia como um possível candidato. E dependendo do restante de seu texto, talvez você tenha de fato uma frequência superior a sete se ainda houver outras frases com pizza no texto. Adicionalmente, se spinach pizza já era um descritor de categoria, você pode precisar adicionar pizza como um descritor em vez disso para capturar todos os registros. Por esse motivo, mude esse limite com cuidado sempre que as categorias já tiverem sido criadas.

Observe que este é um recurso somente de extração; se o seu modelo contiver termos (geralmente contêm) e um termo para o modelo for encontrado no texto, o termo será indexado independentemente de sua frequência.

Por exemplo, suponhamos que você use um modelo de Recursos Básicos que inclua "los angeles" sob o tipo <Location> na biblioteca Core; se o seu documento contém Los Angeles apenas uma vez, então Los Angeles fará parte da lista de conceitos. Para evitar isso, você precisará configurar um filtro para exibir os conceitos que ocorrem pelo menos o mesmo número de vezes que o valor inserido no campo Limitar a extração para conceitos com uma frequência global de pelo menos [n].

Acomodar erros de pontuação. Esta opção normaliza temporariamente o texto contendo erros de pontuação (por exemplo, uso incorreto) durante a extração para melhorar a extractabilidade de conceitos. Esta opção é muito útil quando o texto é curto e de qualidade ruim (como, por exemplo, em respostas de pesquisa sem estrutura, e-mail e dados CRM) ou quando o texto contém muitas abreviações.

Acomode a ortografia para um comprimento mínimo de caracteres de palavra de [n]. Esta opção aplica uma técnica de agrupamento difuso que ajuda a agrupar palavras comumente escritas com ortografia incorreta ou palavras com grafia semelhante sob um conceito. O algoritmo de agrupamento fuzzy tira temporariamente todas as vogais (exceto a primeira) e tira as consoantes duplas / triplas de palavras extraídas e então as compara para ver se elas são iguais para que modeling e modelling fossem agrupadas. No entanto, se cada termo for atribuído a um tipo diferente, excluindo o tipo <Unknown> , a técnica de agrupamento fuzzy não será aplicada.

Também é possível definir o número mínimo de caracteres root necessários antes que o agrupamento difuso seja usado. O número de caracteres raiz em um termo é calculado ao totalizar todos os caracteres e subtrair quaisquer caracteres que formam sufixos de inflexão e, no caso de termos com palavras compostas, determinadores e preposições. Por exemplo, o termo exercises é contado como 8 caracteres raiz na forma "exercício", uma vez que a letra s no final da palavra é uma inflexão (forma plural). Da mesma forma, apple sauce conta como 11 caracteres root ("apple sauce") e manufacturing of cars como 16 caracteres root (“manufacturing car”). Este método de contagem é usado apenas para verificar se o agrupamento difuso deve ser aplicado, mas não influencia como as palavras são correspondidas.

Nota: Se você descobrir que certas palavras são posteriormente agrupadas incorretamente, você pode excluir pares de palavras desta técnica declarando-as explicitamente na seção Fuzzy Grouping: Exceptions sob as propriedades de Recursos Avançados.

Extrair unitermos. Esta opção extrai palavras simples (unitermos), desde que a palavra ainda não faça parte de uma palavra composta e se for um substantivo ou uma classe gramatical não reconhecida.

Extrair entidades não linguísticas. Esta opção extrai entidades não linguísticas, tais como número de telefone, número de seguridade social, horários, datas, moedas, dígitos, porcentagens, endereços de e-mail e endereços HTTP. É possível incluir ou excluir certos tipos de entidades não linguísticas na seção Entidades não linguísticas: Configuração nas propriedades de Recursos avançados. Ao desativar qualquer entidades desnecessárias, o mecanismo de extração não desperdiçará tempo de processamento.

Algoritmo de letras maiúsculas. Esta opção extrai termos simples e compostos que não estão nos dicionários integrados, desde que a primeira letra do termo esteja em maiúscula. Esta opção oferece uma boa maneira de extrair substantivos mais adequados.

Quando possível, agrupar nomes parciais e completos de pessoas. Esta opção agrupa nomes que aparecem de forma diferente no texto. Esse recurso é útil já que os nomes são frequentemente referidos em sua forma completa no início do texto e, então, apenas por uma versão mais curta. Esta opção tenta corresponder qualquer unitermo com o tipo<Unknown> com a última palavra de qualquer um dos termos compostos que é digitado como <Person>. Por exemplo, se doe for localizado e inicialmente digitado como <Unknown>, o mecanismo de extração verifica se quaisquer termos compostos no tipo <Person> incluem doe como a última palavras, tal como john doe. Esta opção não se aplica aos primeiros nomes, pois a maioria nunca é extraída como unitermos.

Permutação máxima de palavras não funcionais. Esta opção especifica o número máximo de palavras sem função que pode estar presente ao aplicar a técnica de permutação. Esta técnica de permutação agrupa frases semelhantes que diferem umas das outras apenas pelas palavras não funcionais (por exemplo, of e the) contidas, independentemente da inflexão. Por exemplo, digamos que você configure esse valor para - no máximo - duas palavras, e company officials e officials of the company foram extraídos. Nesse caso, ambos os termos extraídos seriam agrupados na lista de conceito final já que ambos os termos são considerados o mesmo quando of the é ignorado.

Usar derivação ao agrupar multitermos. Ao processar Big Data, selecione esta opção para agrupar multitermos usando regras de derivação.