nó Logística
A regressão logística, também conhecida como regressão nominal, é uma técnica estatística para classificar registros com base nos valores dos campos de entrada. Ela é semelhante a uma regressão linear, mas usa um campo de destino categórico ao invés de um campo numérico. Os modelos binomiais (para destinos com duas categorias discretas) e modelos multinomiais (para destinos com mais de duas categorias) são suportados.
A regressão logística funciona ao construir um conjunto de equações que relacionam os valores do campo de entrada com as probabilidades associadas a cada uma das categorias do campo de saída. Depois que o modelo é gerado, você pode usá-lo para estimar probabilidades para novos dados. Para cada registro, uma probabilidade de associação é calculada para cada categoria de saída possível. A categoria de destino com a probabilidade mais alta é designada como o valor de saída predito para esse registro.
Exemplo de binomial. Um provedor de telecomunicações está preocupado com o número de clientes que está perdendo para a concorrência. Utilizando dados de uso de serviço, é possível criar um modelo binomial para prever quais clientes são susceptíveis a mudarem para outro provedor e customizar ofertas a fim de reter o máximo de clientes possível. Um modelo binomial é usado porque o destino tem duas categorias distintas (com probabilidade de transferência ou não).
Exemplo de multinomial. Um provedor de telecomunicações segmentou sua base de clientes por padrões de uso de serviço, categorizando os clientes em quatro grupos. Usando dados demográficos para prever a associação ao grupo, é possível criar um modelo multinomial para classificar os clientes em potencial em grupos e, em seguida, customizar ofertas para clientes individuais.
Requisitos. Um ou mais campos de entrada e exatamente um campo de destino categórico com duas ou mais categorias. Para um modelo binomial o alvo deve ter um nível de medição de Flag. Para um modelo multinomial o alvo pode ter um nível de medição de Flag, ou de Nominal com duas ou mais categorias. Campos configurados para Both ou None são ignorados. Os campos utilizados no modelo devem ter seus tipos totalmente instanciados.
Fortes. Os modelos de regressão logística geralmente são muito precisos. Eles podem manipular campos de entrada simbólicos e numéricos. Eles podem fornecer probabilidades preditas para todas as categorias de destino para que uma segunda melhor suposição possa ser facilmente identificada. Os modelos de logística são mais eficientes quando a associação ao grupo for um campo totalmente categórico. Se a associação ao grupo for baseada em valores de um campo de intervalo contínuo (por exemplo, alto QI versus baixo QI), deve-se considerar a utilização de regressão linear para aproveitar as informações mais ricas oferecidas pelo intervalo completo de valores. Os modelos de logística também podem desempenhar a seleção de campo automática, embora outras abordagens, como modelos de árvore ou Seleção de Variável, possam fazer isto mais rapidamente em grandes conjuntos de dados. Por fim, quando os modelos de logística são bem entendidos por muitos analistas e mineradores de dados, eles poderão ser utilizados por alguns como uma linha de base com relação à qual outras técnicas de modelagem podem ser comparadas.
Ao processar grandes conjuntos de dados, é possível melhorar o desempenho consideravelmente ao desativar o teste de razão de verossimilhança, uma opção de saída avançada.