nó C5.0
Este nó usa o algoritmo C5.0 para construir uma árvore de decisão ou um conjunto de regras. Um modelo C5.0 funciona dividindo a amostra com base no campo que fornece o ganho máximo de informação. Cada subamostra definida pela primeira divisão é então dividida novamente, geralmente com base em um campo diferente, e o processo se repete até que as subamostras não possam ser mais divididas. Finalmente, as divisões de nível mais baixo são reexaminadas e aquelas que não contribuem significativamente para o valor do modelo são removidas ou removidas.
C5.0 pode produzir dois tipos de modelos. Uma árvore de decisão é uma descrição direta das divisões encontradas pelo algoritmo. Cada nó terminal (ou "folha") descreve um subconjunto específico dos dados de treinamento, e cada caso nos dados de treinamento pertence exatamente a um nó terminal na árvore. Em outras palavras, exatamente uma predição é possível para qualquer registro de dados específico apresentado para uma árvore de decisão.
Em contraste, um conjunto de regras é um conjunto de regras que tenta fazer previsões para registros individuais. Os conjuntos de regras são derivados das árvores de decisão e, de certa forma, representam uma versão simplificada ou destilada das informações localizadas na árvore de decisão. Os conjuntos de regras geralmente podem reter a maioria das informações importantes de uma árvore de decisão integral, mas com um modelo menos complexo. Devido à maneira com que os conjuntos de regras funcionam, eles não possuem as mesmas propriedades que as árvores de decisão. A diferença mais importante é que, com um conjunto de regras, mais de uma regra poderá ser aplicada a qualquer registro específico ou nenhuma regra poderá ser aplicada. Se diversas regras se aplicarem, cada regra receberá um "voto" ponderado com base na confiança associada a essa regra, e a predição final é decidida combinando os votos ponderados de todas as regras que se aplicarem ao registro em questão. Se nenhuma regra se aplicar, uma predição padrão será designada ao registro.
Exemplo, Um pesquisador médico coletou dados de um conjunto de pacientes que tiveram a mesma doença. Durante o curso do tratamento, cada paciente respondeu a um de cinco medicamentos. É possível usar um modelo C5.0, em conjunto com outros nós, para ajudar a descobrir qual medicamento pode ser apropriado para um futuro paciente com a mesma doença.
Requisitos. Para treinar um modelo C5.0 , deve haver um campo categórico (i.e., nominal ou ordinal) Target , e um ou mais campos Input de qualquer tipo. Campos configurados para Both ou None são ignorados. Os campos utilizados no modelo devem ter seus tipos totalmente instanciados. Um campo de ponderação também pode ser especificado.
Fortes. Os modelos C5.0 são bastante robustos na presença de problemas como dados omissos e grandes números de campos de entrada. Eles geralmente não requerem longos tempos de treinamento para estimar. Além disso, os modelos C5.0 tendem a ser mais fáceis de entender do que alguns outros tipos de modelo, já que as regras derivadas do modelo possuem uma interpretação muito clara. O C5.0 também oferece o método de reforço poderoso para aumentar a precisão da classificação.