Nó QUEST

O QUEST — ou Quick, Unbiased, Efficient Statistical Tree — é um método de classificação binário para construir árvores de decisão. Um dos principais motivos para seu desenvolvimento é reduzir o tempo de processamento necessário para grandes análises da Árvore C&R com muitas variáveis ou com muitos casos. Um segundo objetivo do QUEST é reduzir a tendência localizada nos métodos da árvore de classificação para favorecer entradas que permitem mais divisões, ou seja, campos de entrada contínuos (intervalo numérico) ou aqueles com muitas categorias.

  • O QUEST utiliza uma sequência de regras, com base em testes de significância, para avaliar os campos de entrada em um nó. Para fins de seleção, um mínimo de teste poderá precisar ser executado em cada entrada em um nó. Ao contrário da Árvore C&R, todas as divisões não são examinadas e, ao contrário da Árvore C&R e do CHAID, as combinações de categoria não são testadas quando avaliar um campo de entrada para seleção. Isso acelera a análise.
  • As divisões são determinadas ao executar uma análise discriminante quadrática usando a entrada selecionada nos grupos formados pelas categorias de destino. Esse método mais uma vez melhora a velocidade sobre uma procura exaustiva (Árvore C&R) para determinar a divisão ideal.

Requisitos. Os campos de entrada podem ser contínuos (intervalos numéricos), mas o campo de destino deve ser categórico. Todas as divisões são binárias. Os campos de ponderação não podem ser utilizados. Quaisquer campos ordinais (conjunto ordenado) utilizados no modelo devem ter armazenamento numérico (não sequência de caracteres). Se necessário, o nó Reclassificar pode ser utilizado para convertê-los.

Fortes. Assim como o CHAID, mas ao contrário da Árvore C&R, o QUEST utiliza testes estatísticos para decidir se um campo de entrada é utilizado ou não. Ele também separa os problemas da seleção de entrada e da divisão, aplicando critérios diferentes a cada um deles. Isto contrasta com o CHAID, no qual o resultado do teste estatístico que determina que a seleção de variável também produz a divisão. Da mesma forma, a Árvore C&R usa a medida de mudança de impureza para selecionar o campo de entrada e determinar a divisão.