Nó de árvores aleatórias
O nó Árvores aleatórias pode ser usado com dados em um ambiente distribuído. Neste nó, é construído um modelo de combinação que consiste em várias árvores de decisão.
O nó Árvores Aleatórias é uma classificação baseada em árvore e método de predição construído sobre a metodologia Classificação e Árvore de Regressão. Semelhante à Árvore C&R, esse método de predição utiliza particionamento recursivo para dividir os registros de treinamento em segmentos com valores de campo de saída semelhantes. O nó é iniciado ao examinar os campos de entrada disponíveis para localizar a melhor divisão, medida pela redução em um índice impureza resultante da divisão. A divisão define dois subgrupos, em que cada um deles é dividido posteriormente em mais dois subgrupos, e assim por diante, até que um dos critérios de parada seja acionado. Todas as divisões são binárias (somente dois subgrupos).
O nó Árvores aleatórias usa amostragem de autoinicialização com substituição para gerar dados de amostra. Os dados de amostra são usados para desenvolver um modelo de árvore. Durante o crescimento da árvore, as Árvores Aleatórias não farão a amostragem dos dados novamente. Em vez disso, ele seleciona aleatoriamente parte dos preditores e usa o melhor para dividir um nó da árvore. Este processo é repetido ao dividir cada nó da árvore. Esta é a ideia básica do cultivo de uma árvore em uma floresta aleatória.
Árvores aleatórias usam árvores semelhantes a árvores C&R. Uma vez que tais árvores são binárias, cada campo para dividir os resultados em dois ramos. Para um campo categórico com várias categorias, as categorias são agrupadas em dois grupos com base no critério de divisão interna. Cada árvore cresce na maior extensão possível (não há remoção). Na escoragem, as Árvores Aleatórias combinam escoragens em árvores individuais por maioria de votos (para classificação) ou por média (para regressão).
- Os nós de Árvores Aleatórias selecionam aleatoriamente um número especificado de preditores e usa o melhor da seleção para dividir um nó. Em contraste, a Árvore C&R localiza o melhor de todos os preditores.
- Cada árvore em Árvores Aleatórias cresce totalmente até que cada nó folha normalmente contenha um único registro. Portanto, a profundidade da árvore pode ser muito grande. Mas a árvore C&R padrão usa regras de parada diferentes para o crescimento da árvore, o que geralmente leva a uma árvore muito mais rasa.
As Árvores Aleatórias incluem variáveis comparadas à Árvore C&R:
- O primeiro recurso é bagging, em que as réplicas do conjunto de dados de treinamento são criadas por amostragem com substituição do conjunto de dados original. Esta ação cria amostras bootstrap que são de igual tamanho para o conjunto de dados original, após as quais um modelo de componente é criado em cada réplica. Juntos, esses modelos de componentes formam um modelo de combinação.
- A segunda variável é que, em cada divisão da árvore, apenas uma amostra dos campos de entrada é considerada para a medida impureza.
Requisitos. Para treinar um modelo Árvore Aleatória, um ou mais campos de Entrada e um campo de Destino são necessários. Os campos de destino e de entrada podem ser contínuos (intervalo numérico) ou categóricos. Campos configurados para Ambos ou Nenhum são ignorados. Os campos usados no modelo devem ter seus tipos totalmente instanciados e quaisquer campos ordinais (conjunto ordenado) utilizados no modelo devem ter armazenamento numérico (não sequência de caracteres). Se necessário, o nó Reclassificar pode ser utilizado para convertê-los.
Fortes. Os modelos Árvores Aleatórias são robustos quando você está lidando com conjuntos de dados grandes e vários campos. Devido ao uso de bagging e amostragem de campo, eles são muito menos propensos a super ajuste e, assim, os resultados que são vistos em testes é mais provável de serem repetidos ao usar novos dados.