Analisar o texto para a satisfação do hotel
Este tutorial o ajuda a analisar o texto usando nós especializados no manuseio de texto. Por exemplo, você pode realizar uma análise de sentimento.
Neste tutorial, um gerente de hotel deseja analisar as avaliações do hotel para saber a opinião dos clientes. Os comentários expressam opiniões sobre pessoal do hotel, conforto, limpeza, preço e outras áreas de interesse.


Visualizando o tutorial
Assista a este vídeo para visualizar as etapas deste tutorial. Pode haver pequenas diferenças na interface do usuário mostrada no vídeo. O vídeo deve ser um complemento do tutorial escrito. Este vídeo oferece um método visual para aprender os conceitos e as tarefas desta documentação.
Experimente o tutorial
Neste tutorial, você concluirá estas tarefas:
Exemplo de fluxo do modelador e conjunto de dados
Este tutorial usa o fluxo Hotel Satisfaction no projeto de amostra. O fluxo usa nós Analítica de Texto para analisar revisões fictícias sobre o hotel. O arquivo de dados usado é hotelSatisfaction.csv. A imagem a seguir mostra o fluxo do modelador de amostra.


Tarefa 1: Abrir o projeto de amostra
O projeto de amostra contém vários conjuntos de dados e fluxos de modelador de amostra. Se você ainda não tiver o projeto de amostra, consulte o tópico Tutoriais para criar o projeto de amostra. Em seguida, siga estas etapas para abrir o projeto de amostra:
- Em Cloud Pak for Data no menu de navegação
, escolha Projetos > Exibir todos os projetos.
- Clique em SPSS Modeler Project.
- Clique na guia Assets (Ativos ) para ver os conjuntos de dados e os fluxos do modelador.
Verifique seu progresso
A imagem a seguir mostra a guia Assets (Ativos) do projeto. Agora você está pronto para trabalhar com o fluxo do modelador de amostra associado a este tutorial.

Tarefa 2: Examinar o nó Data Asset
O Hotel Satisfaction inclui vários nós. Siga estas etapas para examinar o nó Data Asset:
- Na guia Assets (Ativos ), abra o fluxo do modelador Hotel Satisfaction e aguarde o carregamento da tela.
- Clique duas vezes no nó hotelSatisfaction.csv. Esse nó é um nó de ativo de dados que aponta para o arquivo hotelSatisfaction.csv no projeto.
- Revise as propriedades do formato do arquivo.
- Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto completo de dados.
Verifique seu progresso
A imagem a seguir mostra o nó Data Asset. Agora você está pronto para examinar o nó Text Mining.

Tarefa 3: Examinar o nó de mineração de texto
A mineração de texto é um processo iterativo que identifica conceitos e padrões relevantes nos dados de texto. Quando você executa o nó Text Mining, o mecanismo de extração lê os dados do texto, identifica os conceitos relevantes e atribui um tipo a cada um deles. Em seguida, você pode revisar os resultados da extração usando o Text Analytics Workbench para ajustar o processo de extração. Você pode executar novamente o nó Text Mining para produzir novos resultados e, em seguida, avaliar os novos resultados. Observe o nó Type entre o nó Data Asset e o nó Text Mining. O nó Type é necessário para identificar corretamente os campos no conjunto de dados. Siga estas etapas para examinar o nó de mineração de texto:
- Clique duas vezes no nó Comments (Text Mining) para ver suas propriedades.
- Defina essas propriedades na seção Fields (Campos ):
- No campo Text (Texto), selecione Comments (Comentários).
- No campo ID, selecione id.Observação: somente o campo Texto é obrigatório.
Figura 3. Propriedades do nó de mineração de texto 
- Na seção Model (Modelo ), observe que o pacote de análise de texto selecionado é Hotel Satisfaction (English)/Topic + Opinion (Satisfação do hotel (Inglês)/Tópico + Opinião).
Um pacote de análise de texto (TAP) é um conjunto predefinido de bibliotecas e recursos linguísticos e não linguísticos avançados, que são agrupados com um ou mais conjuntos de categorias predefinidas. Se nenhum pacote de análise de texto for relevante para o seu aplicativo, você poderá selecionar um modelo de recurso. Um modelo de recurso é um conjunto predefinido de bibliotecas e recursos linguísticos e não linguísticos avançados que foram ajustados para um domínio ou uso específico.
- Na seção Construir modelos, defina essas propriedades:
- Verifique se o campo Build modes está definido como Build interactively (nugget de modelo de categoria). Mais tarde, quando você executar o nó, essa opção iniciará o Text Analytics Workbench, que é uma interface interativa na qual você pode explorar e ajustar os resultados da extração.
- Verifique se o campo Iniciar sessão por está definido como Extração de conceitos e links de texto. A opção Extrair conceitos extrai apenas conceitos, enquanto a extração de TLA gera conceitos e links de texto que são conexões entre tópicos (como serviço, pessoal e comida) e opiniões.
- Expanda a seção Expert e verifique se a opção Accommodate spelling for a minimum word character length of está selecionada com um limite de ortografia de '
5. Esta opção aplica uma técnica de agrupamento difuso que ajuda a agrupar palavras comumente escritas com ortografia incorreta ou palavras com grafia semelhante sob um conceito. O algoritmo de agrupamento fuzzy remove temporariamente as consoantes duplas ou triplas e todas as vogais (exceto a primeira) das palavras extraídas. Em seguida, ele os compara para ver se são iguais. Por exemplo, "locatione "locattoinsão agrupados.Figura 4. Propriedades de especialistas em nós de mineração de texto. 
- Clique em Salvar.
- Passe o mouse sobre o nó Comentários (Mineração de texto) e clique no ícone Executar
.
- No painel Outputs and models (Saídas e modelos ), clique nos resultados com o nome Comments (Comentários ) para abrir o Text Analytics Workbench.
Verifique seu progresso
A imagem a seguir mostra o Text Analytics Workbench. Agora você está pronto para ajustar os resultados.

Tarefa 4: Ajuste os resultados no Text Analytics Workbench
O Text Analytics Workbench contém os resultados da extração e o modelo de categoria contido no pacote de análise de texto. É uma bancada de trabalho interativa na qual você pode explorar e ajustar os resultados extraídos, criar e refinar categorias e criar nuggets de modelos de categorias. Siga estas etapas para ajustar os resultados no Text Analytics Workbench:
conceitos
- Clique na guia Conceitos.
Durante o processo de extração, os dados de texto são analisados para identificar palavras únicas interessantes ou relevantes, como '
airportou 'location, e frases de palavras, como 'airport pick-up. Essas palavras e frases são chamadas coletivamente de termos. Usando os recursos linguísticos, os termos relevantes são extraídos e os termos semelhantes são agrupados em um termo principal que é chamado de conceito.Dessa forma, um conceito pode representar vários termos subjacentes. Depende de como o termo é usado em seu texto e do conjunto de recursos linguísticos que você está usando.
- Clique no ícone Filter (Filtro )
- Você também pode usar um filtro para selecionar um subconjunto de conceitos. A imagem a seguir mostra as diferentes opções:
Figura 5. Text Analytics Workbench - opções de filtro 
Se você quiser remover os filtros e exibir todos os conceitos, clique em Clear Filter (Limpar filtro).
Clique em Cancelar para fechar o painel Filtro.
Links de texto
- Clique na guia Links de texto.
A análise de links de texto (TLA) é uma tecnologia de correspondência de padrões que compara as regras da TLA a conceitos e relacionamentos extraídos encontrados em seu texto. Na guia Links de texto, você pode criar e explorar os padrões de TLA encontrados em seus dados de texto.
- Selecione um padrão de tipo (por exemplo, <Services> + <Positive> ) para ver uma visualização do texto no documento. Se o texto na visualização do documento estiver truncado, clique no ícone Exibir todo o documento
para exibir o texto inteiro.

Categorias
- Clique na guia Categories (Categorias ).
Você pode criar e gerenciar suas categorias. Depois que os conceitos e tipos forem extraídos dos dados de texto, você poderá começar a criar categorias automaticamente usando técnicas como inclusão de conceitos, rede semântica (somente em inglês) ou manualmente.
Como esse fluxo de exemplo usa um modelo de pacote de análise de texto, o modelo de categoria já está preenchido.
- Clique em Score all para pontuar os documentos ou registros. Sempre que uma categoria é criada ou atualizada, você pode ver se algum texto corresponde a um descritor em uma categoria específica. Se uma correspondência for encontrada, o documento ou registro é atribuído a essa categoria. O resultado é que a maioria dos documentos ou registros, se não todos, são atribuídos a categorias com base nos descritores das categorias.
- Expanda uma categoria, por exemplo, Hotel Amenities > Cleanliness > Neg > not cleaned.
- Visualize os documentos na guia Preview (Visualização ) e na guia Descriptors (Descritores ) para ver os dados de origem.
Verifique seu progresso
A imagem a seguir mostra a visualização do documento para a categoria Limpeza. Agora você está pronto para construir o modelo.

Tarefa 5: Criar o modelo
Quando terminar de ajustar o processo de extração, você poderá gerar um modelo de categoria a partir das personalizações e das categorias que você criou. Siga estas etapas para criar e implantar o modelo:
- Clique em Generate a model (Gerar um modelo ) para gerar um modelo de categoria.

- Clique em Build para confirmar que você deseja gerar um modelo de categoria.
- Quando você vir o Success! clique em Retornar ao fluxo.
- Clique em Salvar e sair para salvar suas alterações e o nó Text Mining no fluxo.O nugget de modelo de categoria gerado é exibido em sua tela de fluxo.
Figura 6. Nugget de modelo de categoria gerado 
- Observe os dois nós do Satisfaction Model no fluxo de exemplo. Agora que o Text Analytics Workbench validou e gerou um modelo de categoria, você pode implantá-lo em seu fluxo e pontuar o mesmo conjunto de dados ou pontuar novos dados. Cada modelo usa um modo diferente de pontuação.
Figura 7. Fluxo de exemplo com dois modos para escoragem 
- Clique duas vezes no primeiro nó do Modelo de Satisfação.
- Expanda a seção Configurações para ver que esse nó usa o modo de pontuação Categorias como campos. Com esse modo de pontuação, há tantos registros de saída quanto havia na entrada.
- Clique em Preview data (Visualizar dados). Você pode ver que cada registro agora contém um novo campo para cada categoria selecionada na guia Model (Modelo ). Para cada campo, insira um valor de sinalizador para true e false, como
True/Falseou1/0. Nesse fluxo, os valores são configurados como1e0para agregar resultados e contar o número de respostas positivas, negativas, mistas (positivas e negativas) ou sem pontuação (sem opinião).Figura 8. Resultados do modelo - categorias como campos (1). 
- Feche a janela Visualizar.
- Clique em Cancelar.
- Clique duas vezes no segundo nó Satisfaction Model.
- Expanda a seção Configurações para ver que esse nó usa o modo de pontuação Categorias como registros. Um novo registro é criado para cada par "
category, document. Tipicamente, há mais registros na saída do que havia na entrada. - Clique em Preview data (Visualizar dados). Você pode ver que, junto com os campos de entrada, novos campos também são adicionados aos dados, dependendo do tipo de modelo.
Figura 9. Resultados do modelo - categorias como registros (2). 
- Feche a janela Visualizar.
- Clique em Cancelar.
- Expanda a seção Configurações para ver que esse nó usa o modo de pontuação Categorias como registros. Um novo registro é criado para cada par "
Verifique seu progresso
A imagem a seguir mostra o modelo de satisfação com uma visualização de documento. Agora você está pronto para visualizar os comentários.

Tarefa 6: Visualize os comentários
Você pode obter informações rápidas sobre o que os hóspedes apreciam no hotel visualizando os comentários. Siga estas etapas para criar um gráfico de nuvem de palavras:
- Selecione os comentários positivos:
- Na paleta, expanda a seção Operações de registro.
- Arraste o nó Select para a tela.
- Conecte o supernó Derive Sentiment ao nó Select.
- Clique duas vezes no nó Select para visualizar suas propriedades.
- Para o Modo, selecione Incluir.
- Para a condição, digite "
Sentiment = "Pos". - Clique em Salvar.
- Adicione um gráfico:
- Na paleta, expanda a seção Graphs (Gráficos ).
- Arraste o nó Gráficos para a tela.
- Conecte o nó Select ao nó Charts.
- Crie um gráfico de nuvem de palavras:
- Clique duas vezes no nó Gráficos para visualizar suas propriedades.
- Clique em Launch Chart Builder.
- Em Colunas a serem visualizadas, selecione Comentários.
- Exiba a lista de todos os tipos de gráfico e selecione Nuvem de palavras.
Figura 10. Todos os tipos de gráficos 
- Quando terminar, clique em Retornar ao fluxo.
Verifique seu progresso
A imagem a seguir mostra um gráfico de nuvem de palavras. Agora você está pronto para examinar o nó Text Link Analysis.

Tarefa 7: Examinar o nó de análise de links de texto

- Clique duas vezes no nó Text Link Analysis para ver suas propriedades.
- Defina essas propriedades na seção Fields (Campos ):
- No campo Text (Texto), selecione Comments (Comentários).
- No campo ID, selecione id.Observação: somente o campo Texto é obrigatório.
Figura 11. Propriedades do CAMPO do nó Análise de links de texto. 
- Na seção Copiar recursos de, observe que o modelo de recurso selecionado é Hotel Satisfaction (inglês).
Um modelo de recurso é um conjunto predefinido de bibliotecas e recursos linguísticos e não linguísticos avançados que foram ajustados para um domínio ou uso específico.
- Expanda a seção Expert e verifique se a opção Accommodate spelling for a minimum word character length of está selecionada com um limite de ortografia de '
5.Figura 12. Propriedades de especialista do nó Text Link Analysis. 
- Clique em Salvar.
- Passe o mouse sobre o nó de saída Raw TLA e clique no ícone Run (Executar )
.
- No painel Outputs and models (Saídas e modelos ), clique nos resultados com o nome Raw TLA output (Saída TLA bruta) para ver os resultados.
Figura 13. Saída bruta do TLA. 
Figura 14. Contagem de sentimentos em um nó TLA. 
Verifique seu progresso
A imagem a seguir mostra o fluxo concluído.

Resumo
Esse fluxo de satisfação do hotel mostrou como um gerente de hotel pode analisar as avaliações do hotel para ver as opiniões expressas pelos clientes sobre o pessoal do hotel, o conforto, a limpeza, o preço e outras áreas de interesse. Esse fluxo ilustra duas maneiras de analisar dados de texto, usando um nó Text Mining ou um nó Text Link Analysis.
Próximas etapas
Agora você está pronto para experimentar outros tutoriais do SPSS® Modeler.