Laboratório de regras
O Rule Lab é uma ferramenta interativa do Text Analytics Workbench. Você pode encontrá-lo na guia “Editor de recursos ”. Use-o para testar e aperfeiçoar as regras de análise de links de texto (TLA) antes de aplicá-las ao seu conjunto de dados completo.
Se você quiser criar novas regras de links de texto ou entender como determinadas frases são identificadas durante a análise de links de texto, pode usar um trecho de texto de exemplo para realizar simulações com essas regras. Você pode executar simulações no Laboratório de Regras. Ele oferece um ambiente de teste onde você pode verificar como suas regras TLA se aplicam a dados de texto de exemplo. O laboratório de regras ajuda você a compreender o comportamento das regras e a aperfeiçoá-las para garantir que elas capturem os padrões que você deseja. Você pode usar o Rule Lab para modificar rapidamente as regras e reexecutar simulações, a fim de melhorar a correspondência de padrões sem precisar processar todo o seu conjunto de dados.
Utilizando o laboratório de regras
Você executa testes no laboratório de regras inserindo dados de texto de amostra e, em seguida, executando o processo de extração nessa amostra. O laboratório Rule utiliza o mesmo conjunto de recursos linguísticos e configurações de extração que o processo de análise de links de texto completo. Essas configurações semelhantes ajudam a garantir que os resultados dos testes reflitam com precisão a forma como as regras serão posteriormente aplicadas ao seu conjunto de dados completo. Você pode então verificar os resultados da análise de links de texto para o texto de exemplo, a fim de compreender melhor como ocorre a correspondência.
Durante o processo de extração, o texto da amostra é dividido em frases. E essas frases são então divididas em tokens. Suas regras TLA são então aplicadas para identificar padrões correspondentes no texto tokenizado. Os resultados finais mostram os tokens de cada amostra e quaisquer regras TLA que correspondam a um padrão extraído do texto.
- Tokens
Tokens são palavras ou expressões identificadas durante o processo de extração. Por exemplo, na frase My uncle works in New York, os seguintes tokens podem ser encontrados durante a extração: my, uncle, works in,, e new york. Além disso, uncle poderia ser extraído como um conceito e classificado como
<Unknown>, e new york também poderia ser extraído como um conceito e classificado como<Location>. Todos os conceitos são tokens, mas nem todos os tokens são conceitos. Os tokens também podem ser outras macros, cadeias de caracteres literais e palavras não extraídas. Somente as palavras ou expressões digitadas podem ser conceitos.- Macros
Uma macro é um conjunto reutilizável de elementos de regras de análise de links de texto que combina tipos, cadeias de caracteres literais, outras macros e valores semelhantes por meio do
ORoperador (|). O valor de uma macro distingue maiúsculas de minúsculasmCada macro tem um nome exclusivo, e esse nome é precedido por um “a” minúsculo, comomTopic. Quando uma regra de análise de links de texto faz referência a uma macro, o nome da macro é precedido pelo símbolo$, por exemplo$mTopic. O nome da macro faz distinção entre maiúsculas e minúsculas.Você reutiliza macros em várias regras TLA. Se você criar regras TLA usando macros, isso pode ajudar a simplificar as regras TLA, dividindo regras complexas em partes reutilizáveis. Assim, você pode atualizar a lógica compartilhada em uma única macro, em vez de editar várias regras TLA.
Geração de novas regras TLA
Você pode gerar automaticamente novas regras com base nos resultados da simulação clicando em “Gerar regra ”. A nova regra utiliza os tokens e tipos reais identificados no seu texto de exemplo. SPSS Modeler realiza as seguintes ações para criar a nova regra TLA:
- Ele usa o texto de exemplo como modelo para a regra TLA.
- Ele utiliza automaticamente os primeiros seis tokens correspondentes para gerar a saída sequencialmente. Essa automação pode poupar-lhe o trabalho de inserir manualmente os detalhes básicos da regra. No entanto, é provável que a regra precise de mais revisões.
Por exemplo, na frase “Sem TV, internet ou Wi-Fi”, cada token é analisado (
<wifi><or><internet><,><TV><no><provided>). Esses tokens são então classificados e utilizados na saída da regra exatamente na ordem em que aparecem:#@# no TV, internet or wifi provided [pattern(40)] name=generated_rule_40 value=$mMiscNeg $mTopic $SEP $mTopic $mCoord $mTopic $mSupport output(1)=$1\t#1\t$2\t#2\t$3\t#3\t$4\t#4\t$5\t#5\t$6\t#6 - Ele insere na definição da regra os tokens que foram digitados ou correspondidos a macros durante a simulação.
- Isso dá prioridade às macros em detrimento dos valores de tipo quando um token corresponde a ambos, o que simplifica a estrutura da regra. Por exemplo, na frase “Eu gosto de pizza”, “pizza” é digitado como
<Unknown>e correspondido à macromTopic. Nesse caso,mTopicé usado como elemento na regra gerada.
Depois de gerar uma regra, você pode verificar se ela corresponde corretamente ao padrão voltando ao Laboratório de Regras para testar a nova regra com sua amostra.