Aprendizado de máquina contínuo

Como resultado da pesquisa IBM e inspirado pela seleção natural na biologia, o aprendizado de máquina contínuo está disponível para o nó Previsor Categórico Automático e para o nó Previsor Contínuo Automático.

Uma inconveniência com a modelagem é a desatualização dos modelos devido a mudanças em seus dados ao longo do tempo. Isso normalmente é referido como desvio do modelo ou desvio de conceito. Para ajudar a superar o desvio do modelo de forma efetiva, o SPSS Modeler fornece o aprendizado de máquina automatizado contínuo.

O que é desvio do modelo? Ao construir um modelo baseado em dados históricos, ele pode ficar estagnado. Em muitos casos, os novos dados são sempre recebidos como novas variações, novos padrões, novas tendências etc., que os dados históricos antigos não capturam. Para resolver esse problema, a IBM se inspirou no famoso fenômeno da biologia chamado de seleção natural das espécies. Pense nos modelos como as espécies e nos dados como a natureza. Assim como a natureza seleciona as espécies, devemos deixar que os dados selecionem o modelo. Há uma grande diferença entre os modelos e as espécies: as espécies podem evoluir, mas os modelos são estáticos depois de construídos.

Há duas condições prévias para que as espécies se desenvolvam: a primeira é a mutação de gene e a segunda é a população. Agora, de uma perspectiva de modelagem, para atender à primeira condição (mutação de gene), deve-se introduzir novas mudanças de dados no modelo existente. Para atender à segunda condição prévia (população), deve-se usar uma série de modelos em vez de apenas um. O que pode representar uma série de modelos? Um Conjunto de Modelos de Combinação (EMS)!

A figura a seguir ilustra como um EMS pode se desenvolver. A parte superior esquerda da figura representa os dados históricos com partições híbridas. As partições híbridas asseguram um EMS inicial abrangente. A parte superior direita da figura representa um novo chunk de dados que se torna disponível, com barras verticais em cada lado. A barra vertical esquerda representa o status atual e a barra vertical direita representa o status quando há um risco de desvio do modelo. Em cada nova rodada de aprendizado de máquina contínuo, duas etapas são executadas para desenvolver o seu modelo e evitar desvios.

Primeiro, você constrói um conjunto de modelos de combinação (EMS) usando os dados de treinamento existentes. Em seguida, quando um novo chunk de dados se tornar disponível, novos modelos serão construídos com relação a esses novos dados e incluídos no EMS como modelos de componentes. Os pesos dos modelos de componentes existentes no EMS são reavaliados por meio do uso dos novos dados. Como resultado dessa reavaliação, os modelos de componentes que tiverem pesos maiores serão selecionados para a predição atual e os modelos de componentes que tiverem pesos menores poderão ser excluídos do EMS. Como esse processo atualiza o EMS para pesos e instâncias do modelo, ele se desenvolvendo de maneira flexível e eficiente para lidar com as inevitáveis mudanças em seus dados ao longo do tempo.

Figura 1. Aprendizado de máquina automático contínuo
Aprendizado de máquina automático contínuo

O conjunto de modelos de combinação (EMS) é um nugget de modelo automático gerado e há um link de atualização entre o nó de modelagem automática e o nugget de modelo automático gerado que define o relacionamento de atualização entre eles. Ao ativar o aprendizado de máquina automático contínuo, novos ativos de dados são alimentados continuamente nos nós de modelagem automática para gerar novos modelos de componentes. O nugget do modelo é atualizado em vez de substituído.

A figura a seguir fornece um exemplo da estrutura interna de um EMS em um cenário de aprendizado de máquina contínuo. Apenas os três principais modelos de componentes são selecionados para a predição atual. Para cada modelo de componente (rotulado como M1, M2 e M3), dois tipos de pesos são mantidos. O Peso do Modelo Atual (CMW) descreve o desempenho de um modelo de componente com um novo chunk de dados e o Peso do Modelo Acumulado (AMW) descreve o desempenho abrangente de um modelo de componente com relação a chunks recentes de dados. O AMW é calculado iterativamente por meio do CMW e dos valores anteriores de si mesmo e há um hiperparâmetro beta para balanceamento entre eles. A fórmula para calcular o AMW é chamada de média móvel exponencial.

Quando um novo chunk de dados se torna disponível, primeiro o SPSS Modeler o utiliza para construir alguns novos modelos de componentes. Nesta figura de exemplo, o modelo quatro (M4) é construído com o CMW e o AMW calculados durante o processo de construção do modelo inicial. Em seguida, o SPSS Modeler usa o novo chunk de dados para reavaliar medidas de modelos de componentes existentes (M1, M2 e M3) e atualizar o CMW e o AMW com base nos resultados da reavaliação. Por fim, o SPSS Modeler pode reordenar os modelos de componentes com base no CMW ou no AMW e selecionar os três principais modelos de componentes apropriadamente.

Nesta figura, o CMW é descrito usando valor normalizado (soma = 1) e o AMW é calculado com base no CMW. No SPSS Modeler, o valor absoluto (igual à medida ponderada pela avaliação selecionada, por exemplo, precisão) é escolhido para representar o CMW e o AMW para simplicidade.

Figura 2 Estrutura do EMS
Estrutura do EMS
Observe que existem dois tipos de pesos definidos para cada modelo de componente EMS, ambos os quais poderiam ser usados para a seleção de modelos N top e modelo de componente eliminar:
  • O Peso do Modelo Atual (CMW) é calculado por meio da avaliação com relação ao novo chunk de dados (por exemplo, precisão de avaliação no novo chunk de dados).
  • O Peso do Modelo Acumulado (AMW) é calculado combinando o CMW e o AMW existente (por exemplo, média móvel exponencialmente ponderada (EWMA).

    Fórmula de média móvel exponencial para calcular AMW:
    Fórmula de média móvel exponencial para calcular AMW

No SPSS Modeler, após a execução de um nó Previsor Categórico Automático para gerar um nugget do modelo, as opções de modelo a seguir estão disponíveis para o aprendizado de máquina contínuo:

  • Ativar o aprendizado de máquina automático contínuo durante a atualização do modelo. Selecione esta opção para ativar o aprendizado de máquina contínuo. Lembre-se de que metadados consistentes (modelo de dados) devem ser usados para treinar o modelo automático contínuo. Se você selecionar esta opção, outras opções estão ativadas.
  • Ativar a reavaliação automática de pesos do modelo. Esta opção controla se as medidas de avaliação (precisão, por exemplo) são calculadas e atualizadas durante a atualização do modelo. Ao selecionar essa opção, um processo de avaliação automática é executado após o EMS (durante a atualização do modelo). Isso ocorre porque geralmente é necessário reavaliar os modelos de componentes existentes usando novos dados para refletir o estado atual dos seus dados. Em seguida, os pesos dos modelos de componentes do EMS são designados de acordo com os resultados da reavaliação e os pesos são usados para decidir a proporção que um modelo de componente contribui para com a predição final da combinação. Esta opção é selecionada por padrão.
    Figura 3. Configurações de modelo
    Configurações de modelo
    Figura 4. Destino de sinalização
    Destino de sinalização
    A seguir estão o CMW e o AMW suportados para o nó Previsor Categórico Automático:
    Tabela 1. CMW e AMW suportados
    Tipo de destino CMW AMW
    destino de sinalização Precisão geral
    Área sob a curva
    Precisão Acumulada
    AUC Acumulada
    Configurar destino Precisão geral Precisão acumulada

    As três opções a seguir estão relacionadas ao AMW, que é usado para avaliar o desempenho de um modelo de componente durante os períodos de chunk de dados recentes:

  • Ativar o fator acumulado durante a reavaliação de pesos do modelo. Ao selecionar esta opção, o cálculo do AMW é ativado durante a reavaliação de pesos do modelo. A AMW representa o desempenho abrangente de um modelo de componente EMS durante os períodos de chunk de dados recentes, relacionados com o fator acumulado β definido na fórmula AMW listada anteriormente, que você pode ajustar nas propriedades do nó. Quando esta opção não é selecionada, apenas o CMW é calculado. Esta opção é selecionada por padrão.
  • Executar redução do modelo com base no limite acumulado durante a atualização do modelo. Selecione esta opção para que os modelos de componentes com um valor de AMW abaixo do limite especificado sejam removidos do EMS de modelo automático durante a atualização do modelo. Isso pode ser útil ao descartar modelos de componentes inutilizáveis para evitar que o EMS de modelo automático se torne muito pesado.
    A avaliação do valor limite acumulado está relacionada à medida ponderada usada quando Voto ponderado pela avaliação é selecionado como o método de combinação. Veja o seguinte.
    Figura 5. Destinos de conjunto e de sinalização
    Destinos de conjunto e de sinalização

    Note que ao selecionar Precisão do modelo para a medida ponderada pela avaliação, os modelos com uma precisão acumulada abaixo do limite especificado são excluídos. Além disso, ao selecionar Área sob a curva para a medida ponderada pela avaliação, os modelos com uma AUC acumulada abaixo do limite especificado são excluídos.

    Por padrão, a Precisão do modelo é usada para a medida ponderada pela avaliação para o nó Previsor Categórico Automático e há uma medida de ROC da AUC opcional no caso de destinos de sinalização.

  • Usar voto ponderado pela avaliação acumulada. Selecione esta opção para que o AMW seja usado com relação à escoragem/predição atual. Caso contrário, o CMW será usado por padrão. Esta opção é ativada quando Voto ponderado pela avaliação é selecionado para o método de combinação.

    Observe que, ao selecionar esta opção para os destinos de sinalização, se você selecionar Precisão do modelo para a medida ponderada pela avaliação, a Precisão acumulada será usada como o AMW para executar a escoragem atual. Ao selecionar Área sob a curva para a medida ponderada pela avaliação, a AUC acumulada será usada como o AMW para executar a escoragem atual. Ao não selecionar esta opção e selecionar Precisão do modelo para a medida ponderada pela avaliação, a Precisão geral é usada como o CMW para executar a escoragem atual. Ao selecionar Área sob a curva, a Área sob a curva é usada como o CMW para executar a escoragem atual.

    Para configurar destinos, ao selecionar esta opção Usar voto ponderado pela avaliação acumulada, a Precisão acumulada é usada como o AMW para executar a escoragem atual. Caso contrário, a Precisão geral será usada como o CMW para executar a escoragem atual.

Com o aprendizado de máquina automático contínuo, o nugget do modelo automático se desenvolve o tempo todo reconstruindo o modelo automático, o que assegura que você obtenha a versão mais atualizada que reflete o estado atual dos seus dados. O SPSS Modeler fornece a flexibilidade para os N principais modelos de componentes diferentes no EMS a serem selecionados de acordo com os seus pesos atuais, o que mantém o ritmo com a variação de dados durante períodos diferentes.

Nota: O nó Numeric Auto é um caso muito mais simples, fornecendo um subconjunto das opções no nó Auto Classifier.

Exemplo

Neste exemplo, o aprendizado de máquina contínuo é usado na indústria de telecomunicações para prever o comportamento e reter clientes.

No fluxo a seguir, o ativo de dados inclui informações sobre clientes que partiram no último mês (coluna Churn). Como novos dados se tornam disponíveis todos os meses, este cenário é adequado para o aprendizado de máquina contínuo. Neste exemplo, os dados de janeiro (Jan) são usados para construir um modelo automático inicial e, em seguida, os dados de fevereiro (Feb) são usados para aprimorar o modelo automático por meio do aprendizado de máquina contínuo.

Figura 6. Fluxo de exemplo
Fluxo de exemplo
Na ramificação superior do fluxo, após o nó Ativo de Dados, há um nó Filtro para filtrar alguns campos sem importância. No término da ramificação, há um nó de modelagem Previsor Categórico Automático do terminal. De acordo com as configurações especializadas do nó, selecionamos os algoritmos a serem usados para o processo de treinamento. Neste exemplo, selecionamos três algoritmos: Regressão Logística, Rede Bayesiana e Rede Neural. Em seguida, executamos o fluxo para gerar um nugget do modelo automático.

Agora vamos analisar o que está dentro do nugget do modelo automático. Podemos ver que ele contém três modelos de componentes para os três algoritmos que selecionamos. Para cada modelo de componente, há várias medidas de avaliação geradas (como a precisão e a área sob a curva). Essas medidas de avaliação descrevem o desempenho de um modelo de componente com relação aos dados de treinamento (o conjunto de dados de janeiro). É possível selecionar quais modelos de componentes serão usados na predição atual da combinação.

Figura 7. Medidas de avaliação
Medidas de avaliação

Também é possível ver medidas de avaliação acumuladas. Essas medidas acumuladas são para o aprendizado de máquina contínuo, uma vez que elas descrevem o desempenho de um modelo de componente com mudanças de dados recentes, para que você esteja ciente do desempenho abrangente do modelo durante um período de tempo. Como este é o nosso modelo automático inicial, vemos que os valores iniciais para as medidas acumuladas são os mesmos das medidas atuais relacionadas. Por padrão, como as medidas de avaliação são calculadas com relação aos dados de treinamento, pode haver algum grau de superajuste. Para evitar isso, o nó Previsor Categórico Automático fornece uma opção de construção que calcula medidas de avaliação mais estáveis por meio de validação cruzada.

A seguir, vejamos como a predição final da combinação é gerada. Ao abrir as propriedades de um modelo automático, em Destinos de sinalização da combinação, o campo de perda de clientes de destino de treinamento é um destino de sinalização sim/não. Em Configurar destinos da combinação (para configurar campos de destino que contêm mais de dois valores), há um menu suspenso Método de combinação. Várias opções estão disponíveis no menu suspenso (por exemplo, Voto da maioria significa que cada modelo de componente contém um chamado para votar e Voto ponderado pela confiança significa que o campo de confiança da predição de cada modelo de componente é usado como o peso do voto, em que a maior confiança tem mais influência na predição final da combinação). Da mesma forma, para permitir um melhor suporte ao aprendizado de máquina contínuo, o Voto ponderado pela avaliação está disponível para que a medida de avaliação do modelo de componente (por exemplo, precisão do modelo ou área sob a curva) seja usada como peso do voto. No caso de um destino de sinalização, também há uma opção de selecionar uma medida de avaliação específica como o peso do voto quando Voto ponderado pela avaliação é usado. No caso de um destino configurado, apenas a Precisão é suportada atualmente.

Figura 8. Destinos de conjunto e de sinalização
Destinos de conjunto e de sinalização

Ative o aprendizado de máquina contínuo nas configurações de Combinação comum. Em seguida, podemos usar os dados de fevereiro para ver o que está acontecendo. Podemos selecionar dois algoritmos diferentes para distinguir entre os algoritmos de modelos de componentes existentes. Em seguida, depois de reconstruir o fluxo e visualizar o conteúdo do modelo automático, dois novos modelos de componentes são incluídos (C5 e C&RT). Notamos também que as medidas de avaliação para os modelos de componentes existentes foram recalculadas. As medidas do CMW e do AMW são diferentes de anteriormente. Agora podemos compará-los com as medidas correspondentes no modelo automático original.

Figura 9. Medidas de avaliação
Medidas de avaliação

O que vem a seguir? Com o modelo automático aprimorado, podemos selecionar uma medida de avaliação priorizada e obter modelos de componentes top-N ordenados por essa medida. Em seguida, podemos usar os N principais modelos de componentes para participar da predição final da combinação para solicitações de análise preditiva recebidas. Além disso, se Voto ponderado pela avaliação for selecionado para o Método de combinação, será possível usar medidas acumuladas como pesos de voto simplesmente selecionando a opção Usar voto ponderado pela avaliação acumulada nas configurações de Combinação comum. Se a opção não estiver selecionada, as medidas do CMW serão usadas por padrão no voto ponderado pela avaliação.

Com o aprendizado de máquina contínuo, o modelo automático se desenvolverá o tempo todo já que ele está se reconstruindo continuamente com relação aos novos chunk de dados, assegurando que o seu modelo seja a versão mais atualizada que reflete o status atual dos dados. Isso permite a flexibilidade de selecionar os N principais modelos de componentes diferentes no EMS de acordo com as suas medidas de avaliação atuais ou acumuladas, para manter o ritmo com a variação de dados durante períodos diferentes.

Periodicamente, você pode escolher implementar o modelo Auto mais atualizado no Watson Machine Learning periodicamente para sua conveniência.