Nó de Regras de associação
As regras de associação associam uma determinada conclusão (a compra de um produto específico, por exemplo) com um conjunto de condições (a compra de vários outros produtos, por exemplo).
Por exemplo, a regra
beer <= cannedveg & frozenmeal (173, 17.0%, 0.84)
afirma que beer geralmente ocorre quando cannedveg e frozenmeal ocorrem juntos. A regra é 84%
confiável e se aplica a 17% dos dados, ou 173 registros. Os algoritmos de regra de associação localizam automaticamente as associações que você poderia localizar manualmente usando técnicas de visualização, como o nó da web.
A vantagem dos algoritmos de regra de associação sobre os algoritmos de árvore de decisão mais padrão (Árvores C5.0 e C&R) é que podem existir associações entre qualquer um dos atributos. Um algoritmo de árvore de decisão construirá regras com apenas uma única conclusão, ao passo que os algoritmos de associação tentam localizar muitas regras, cada qual podendo ter uma conclusão diferente.
A desvantagem dos algoritmos de associação é que eles tentam localizar padrões dentro de um espaço de procura potencialmente muito grande e, como consequência, podem requerer muito mais tempo para executar do que um algoritmo de árvore de decisão. Os algoritmos usam um método de geração e teste para localizar regras - regras simples são geradas inicialmente e são validadas em relação ao conjunto de dados. As boas regras são armazenadas e todas as regras, sujeitas a várias restrições, são então especializadas.A especialização é o processo de incluir condições em uma regra. Essas novas regras são, então, validadas com relação aos dados e o processo armazena iterativamente as melhores e mais interessantes regras localizadas. O usuário normalmente fornece algum limite para o número possível de antecedentes para permitir em uma regra e várias técnicas baseadas em teoria de informações ou esquemas de indexação eficientes são usadas para reduzir o espaço potencialmente grande de procura.
No término do processamento, uma tabela das melhores regras é apresentada. Ao contrário de uma árvore de decisão, esse conjunto de regras de associação não pode ser usado diretamente para fazer predições da forma com que um modelo padrão (como uma árvore de decisão ou uma rede neural) pode. Isso é devido a muitas conclusões possíveis diferentes para as regras. Outro nível de transformação é necessário para transformar as regras de associação em um conjunto de regras de classificação. Consequentemente, as regras de associação produzidas por algoritmos de associação são conhecidas como modelos não refinados. Embora o usuário possa procurar esses modelos não refinados, eles não podem ser usados explicitamente como modelos de classificação, a menos que o usuário diga ao sistema para gerar um modelo de classificação a partir do modelo não refinado. Isso é feito no navegador por meio de uma opção do menu Gerar.
Dois algoritmos de regra de associação são suportados:
- O nó a priori extrai um conjunto de regras dos dados, retirando as regras com o maior conteúdo de informação. A Priori oferece cinco métodos diferentes de seleção de regras e usa um esquema de indexação sofisticado para processar conjuntos de dados grandes com eficiência. Para grandes problemas, o A Priori geralmente é mais rápido para treinar; ele não tem um limite arbitrário no número de regras que podem ser retidas e pode manipular regras com até 32 condições prévias. O A Priori requer que os campos de entrada e saída sejam todos categóricos, mas entrega melhor desempenho por ser otimizado para esse tipo de dado.
- O nó Sequência descobre regras de associação em dados sequenciais ou orientados por tempo. Uma sequência é uma lista de conjuntos de itens que tende a ocorrer em uma ordem previsível. Por exemplo, um cliente que compra um aparelho de barbear e uma loção pós-barba pode comprar um creme de barbear na próxima compra. O nó Sequência é baseado no algoritmo de regras de associação CARMA, que usa um método eficiente de duas passagens para localizar sequências.