Nó Árvore C&R

O nó Árvore de Classificação e Regressão (C&R) é um método de classificação e de predição baseado em árvore. Semelhante ao C5.0, esse método utiliza particionamento recursivo para dividir os registros de treinamento em segmentos com valores de campo de saída semelhantes. O nó da árvore C&R começa examinando os campos de entrada para encontrar a melhor divisão, medida pela redução em um índice de impureza resultante da divisão. A divisão define dois subgrupos, em que cada um deles é dividido posteriormente em mais dois subgrupos, e assim por diante, até que um dos critérios de parada seja acionado. Todas as divisões são binárias (somente dois subgrupos).

Remoção

As Árvores C&R fornecem a opção de primeiro crescer a árvore e, em seguida, podá-la com base em um algoritmo de complexidade de custo que ajusta a estimativa de risco com base no número de nós terminais. Este método, que permite que a árvore cresça para um tamanho grande antes da poda com base em critérios mais complexos, pode resultar em árvores menores com melhores propriedades de validação cruzada. O aumento do número de nós terminais geralmente reduz o risco para dados atuais (treinamento), mas o risco real poderá ser maior quando o modelo é generalizado para dados não vistos. Em um caso extremo, suponha que você tenha um nó terminal separado para cada registro no conjunto de treinamento. A estimativa de risco seria 0%, uma vez que cada registro cai em seu próprio nó, mas o risco de classificação errada para dados não vistos (teste) quase certamente seria maior que 0. A medida de complexidade de custo tenta compensar isso.

Exemplo, Uma empresa de TV a cabo encomendou um estudo de marketing para determinar quais clientes poderiam assinar um serviço de notícias interativas via cabo. Ao usar os dados do estudo, é possível criar um fluxo no qual o campo de destino é a intenção de comprar a assinatura e os campos preditores incluem idade, sexo, educação, categoria de renda, horas gastas assistindo televisão a cada dia e o número de filhos. Ao aplicar um nó Árvore C&R ao fluxo, você será capaz de prever e classificar as respostas para obter a maior taxa de resposta para sua campanha.

Requisitos. Para treinar um modelo C & R Tree, você precisa de um ou mais campos Input e exatamente um campo Target . Os campos de destino e de entrada podem ser contínuos (intervalo numérico) ou categóricos. Campos configurados para Both ou None são ignorados. Os campos usados no modelo devem ter seus tipos totalmente instanciados e quaisquer campos ordinais (conjunto ordenado) utilizados no modelo devem ter armazenamento numérico (não sequência de caracteres). Se necessário, o nó Reclassificar pode ser utilizado para convertê-los.

Fortes. Os modelos da Árvore C&R são bastante robustos na presença de problemas como dados omissos e grandes números de campos. Eles geralmente não requerem longos tempos de treinamento para estimar. Além disso, os modelos de Árvore C&R tendem a ser mais fáceis de entender do que alguns outros tipos de modelo, já que as regras derivadas do modelo possuem uma interpretação muito clara. Ao contrário do C5.0, a Árvore C&R pode acomodar campos de saída contínuos e também categóricos.