Criando um experimento de análise de texto

Use o recurso de análise de texto do AutoAI's para realizar a análise de texto de seus experimentos. Por exemplo, execute uma análise básica de sentimentos para prever um resultado baseado em comentários de texto.

Nota: a análise de texto está disponível apenas para a classificação AutoAI e os experimentos de regressão. Este recurso não está disponível para experimentos de séries temporais.

Visão geral de análise de texto

Quando você cria um experimento que usa o recurso de análise de texto, o processo de AutoAI usa o algoritmo word2vec para transformar o texto em vetores e, em seguida, compara esses vetores a fim de estabelecer o impacto na coluna de previsão.

O algoritmo word2vec utiliza um corpus de texto como entrada e gera um conjunto de vetores. Ao transformar texto em representação numérica, ele pode detectar e comparar palavras semelhantes. Quando treinado com dados suficientes, word2vec pode fazer previsões precisas sobre o significado de uma palavra ou o relacionamento com outras. As predições podem ser usadas para analisar texto e adivinhar seu significado em aplicativos de análise de sentimentos.

Durante a fase de engenharia de recursos do treinamento do experimento, são gerados 20 recursos para a coluna de texto, utilizando o algoritmo word2vec . A detecção automática de recursos de texto é baseada na análise do número de valores exclusivos em uma coluna e no número de tokens em um registro (número mínimo = 3). Se o número de valores exclusivos for menor que o número de todos os valores dividido por 5, a coluna não será tratada como um texto.

Quando o experimento é concluído, é possível revisar os resultados da engenharia de recurso na página de detalhes do pipeline. Também é possível salvar um pipeline como um notebook a fim de revisar as transformações e exibir uma visualização das transformações.

Observação: ao revisar o experimento, se você determinar que uma coluna de texto não foi detectada e processada pela detecção automática, será possível especificar essa coluna manualmente nas configurações do experimento.

Exemplo: analisando comentários do cliente

Neste exemplo, os comentários para uma empresa de aluguel de carros fictícios são usados para treinar um modelo que prevê uma classificação de satisfação quando um novo comentário é inserido.

Assista a este vídeo curto para ver um exemplo e, em seguida, consulte mais detalhes sobre o recurso de texto abaixo do vídeo.

Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.

  • Transcrição de vídeo
    Horário Transcrição
    00:00 Neste vídeo, você verá como criar um experimento de AutoAI a fim de realizar uma análise de impressões em um arquivo de texto.
    00:09 É possível usar a engenharia de recursos de texto para realizar análises de texto em seus experimentos.
    00:15 Por exemplo, execute uma análise básica de sentimentos para prever um resultado baseado em comentários de texto.
    00:22 Comece incluindo um ativo em um projeto, um novo experimento de AutoAI.
    00:29 Basta fornecer um nome, uma descrição, selecionar um serviço de machine learning e criar o experimento.
    00:38 Quando o construtor de experimentos de AutoAI for exibido, será possível incluir o conjunto de dados.
    00h43 Nesse caso, o conjunto de dados já está armazenado no projeto como um ativo de dados.
    00:48 Selecione o ativo a incluir no experimento.
    00:53 Antes de continuar, veja os dados.
    00h56 Este conjunto de dados tem duas colunas.
    00:59 A primeira contém os comentários dos clientes e a segunda contém 0, para "Não satisfeito", ou 1, para "Satisfeito".
    01:08 Como ela não é uma previsão de séries temporais, selecione "Não" para essa opção.
    01:13 Em seguida, selecione a coluna a prever, que é "Satisfação" neste exemplo.
    01:19 O AutoAI determina que a coluna de satisfação contém dois valores possíveis, o que a torna adequada para um modelo de classificação binária.
    01:28 Além disso, a classe positiva é 1, para "Satisfeito".
    01:32 Abra as configurações do experimento se quiser customizá-lo.
    01:36 No painel de origem de dados, você verá algumas opções para a engenharia de recursos de texto.
    01:41 É possível selecionar automaticamente as colunas de texto ou aprimorar o exercício do controle especificando-as manualmente para a engenharia de recursos de texto.
    01:52 Também é possível selecionar quantos vetores criar para cada coluna durante a engenharia de recursos de texto.
    01:58 Um número mais baixo é mais rápido e um número mais alto é mais preciso, só que mais lento.
    02:03 Agora, execute o experimento para visualizar as transformações e o progresso.
    02:09 Quando você cria um experimento que usa o recurso de análise de texto, o processo de AutoAI usa o algoritmo word2vec para transformar o texto em vetores e, em seguida, compara esses vetores a fim de estabelecer o impacto na coluna de previsão.
    02:23 Durante a fase de engenharia de recursos do treinamento do experimento, vinte recursos são gerados para a coluna de texto usando o algoritmo word2vec.
    02:33 Quando o experimento é concluído, é possível revisar os resultados da engenharia de recurso na página de detalhes do pipeline.
    02:40 No painel Resumo de recursos, é possível revisar as transformações de texto.
    02:45 É possível ver que o AutoAI criou vários recursos de texto aplicando a função de algoritmo aos elementos da coluna, além da importância do recurso, mostrando quais recursos contribuem mais para sua saída de previsão.
    02:59 É possível salvar este pipeline como um modelo ou um notebook.
    03:03 O notebook contém o código para ver as transformações e as visualizacoes associadas.
    03:09 Neste caso, crie um modelo.
    03:13 Use o link para visualizar o modelo.
    03:16 Agora, promova o modelo para um espaço de implementação.
    03:23 Estes são os detalhes do modelo e, com base neles, é possível implementar o modelo.
    03:28 Neste caso, será uma implementação on-line.
    03:36 Após a conclusão, abra a implementação.
    03:39 No app de teste, é possível especificar um ou mais comentários para analisar.
    03:46 Em seguida, clique em "Prever".
    03:49 Prevê-se que o primeiro cliente não está satisfeito com o serviço.
    03:54 Além disso, prevê-se que o segundo cliente está satisfeito com o serviço.
    03:59 Encontre mais vídeos na documentação do Cloud Pak for Data as a Service.

Dado um conjunto de dados que contém uma coluna de comentários de revisão para a experiência de aluguel (Customer_service) e uma coluna que contém uma classificação de satisfação binária (Satisfação), em que 0 representa um comentário negativo e 1 representa um comentário positivo, o experimento é treinado para prever uma classificação de satisfação quando novo feedback é inserido.

Treinando um experimento de transformação de texto

Depois de carregar o conjunto de dados e especificar a coluna de predição (Satisfação), as Configurações de Experimento selecionam a opção Usar engenharia de recursos de texto .

Configurações de origem de dados para usar engenharia de recursos de texto

Observe alguns dos detalhes para realizar o ajuste do experimento de análise de texto:

  • É possível aceitar a seleção padrão automática das colunas de texto ou praticar o exercício do controle especificando manualmente as colunas para a engenharia de recursos de texto.
  • À medida que o experimento é executado, um padrão de 20 recursos é gerado para a coluna de texto usando o algoritmo word2vec . É possível editar esse valor para aumentar ou diminuir o número de recursos. Quanto mais vetores você gerar mais preciso é o seu modelo, mas o tomador de treinamento mais longo.
  • O restante das opções se aplica a todos os tipos de experimentos para que você possa afinar como lidar com os dados finais de treinamento.

Execute o experimento para visualizar as transformações em andamento.

Tabela de classificação de pipeline do algoritmo..

Selecione o nome de um pipeline, em seguida, clique em Resumo do recurso para revisar as conversões de texto

Resumo de recurso de pipeline individual..

Também é possível salvar o pipeline de experimento como um bloco de notas e revisar as transformações como uma visualização.

Implementando e pontuando um modelo de transformação de texto

Ao pontuar este modelo, insira novos comentários para obter uma previsão com uma pontuação de confiança para saber se o comentário resulta em uma classificação de satisfação positiva ou negativa.

Por exemplo, inserir o comentário "Demoramos quase três horas para encontrar um carro. Foi absurdo " prevê um índice de satisfação de 0 com um escore de confiança de 95%.

Como prever uma pontuação de satisfação

Próximas etapas

Construindo um experimento de previsão de série temporal