연관 규칙 노드

연관 규칙은 특정 결론 (예를 들어, 특정 제품의 구매) 을 조건 세트 (예를 들어, 여러 다른 제품의 구매) 와 연관시킵니다.

예를 들어, 다음 규칙은

beer <= cannedveg & frozenmeal (173, 17.0%, 0.84)

beer 는 종종 cannedvegfrozenmeal 가 함께 발생할 때 발생합니다. 이 규칙은 84% 신뢰할 수 있으며 데이터의 17% 또는 173개레코드에 적용됩니다. 연관 규칙 알고리즘은 웹 노드와 같은 시각화 기술을 사용하여 수동으로 찾을 수 있는 연관을 자동으로 찾습니다.

보다 표준적인 의사결정 트리 알고리즘 (C5.0 및 C & R 트리) 에 비해 연관 규칙 알고리즘의 장점은 모든 속성 사이에 연관이 존재할 수 있다는 점입니다. 의사결정 트리 알고리즘은 단일 결론만으로 규칙을 빌드하는 반면, 연관 알고리즘은 각각 다른 결론을 가질 수 있는 많은 규칙을 찾으려고 시도합니다.

연관 알고리즘의 단점은 잠재적으로 매우 큰 검색 공간 내에서 패턴을 찾으려고 하므로 의사결정 트리 알고리즘보다 실행하는 데 훨씬 더 많은 시간이 필요할 수 있다는 것입니다. 알고리즘은 생성 및 테스트 방법을 사용하여 규칙을 찾습니다. 단순 규칙은 처음에 생성되며 데이터 세트에 대해 유효성이 검증됩니다. 좋은 규칙이 저장되고 다양한 제한조건에 따라 모든 규칙이 특수화됩니다. 특수화 는 규칙에 조건을 추가하는 프로세스입니다. 그런 다음 이러한 새 규칙은 데이터에 대해 유효성 검증되고 프로세스는 반복적으로 발견된 최상의 또는 가장 관심있는 규칙을 저장합니다. 사용자는 일반적으로 규칙에서 허용할 수 있는 전항 수에 대한 일부 제한을 제공하며, 정보 이론 또는 효율적인 인덱싱 스킴을 기반으로 하는 다양한 기술을 사용하여 잠재적으로 큰 검색 공간을 줄입니다.

처리 종료 시 최상의 규칙 테이블이 표시됩니다. 의사결정 트리와 달리, 이 연관 규칙 세트는 표준 모델 (예: 의사결정 트리 또는 신경망) 이 예측할 수 있는 방식으로 예측하는 데 직접 사용할 수 없습니다. 이는 규칙에 대한 여러 가지 가능한 결론 때문입니다. 연관 규칙을 분류 규칙 세트로 변환하려면 다른 레벨의 변환이 필요합니다. 따라서 연관 알고리즘에 의해 생성된 연관 규칙을 세분화되지 않은 모델이라고 합니다. 사용자가 이러한 세분화되지 않은 모델을 찾아볼 수 있지만 사용자가 세분화되지 않은 모델에서 분류 모델을 생성하도록 시스템에 지시하지 않는 한 명시적으로 분류 모델로 사용할 수 없습니다. 이는 브라우저에서 생성 메뉴 옵션을 통해 수행됩니다.

두 개의 연관 규칙 알고리즘이 지원됩니다.

  • Apriori 노드는 데이터에서 규칙 세트를 추출하여 정보 컨텐츠가 가장 높은 규칙을 가져옵니다. Apriori에서는 규칙을 선택하는 다섯 가지 다른 방법을 제공하고 정교한 색인 작성 체계를 사용하여 대형 데이터 세트를 효율적으로 처리합니다. 큰 문제의 경우 Apriori는 일반적으로 더 빠르게 훈련합니다. 보유할 수 있는 규칙 수에 대한 임의의 제한이 없으며 최대 32개의 전제조건이 있는 규칙을 처리할 수 있습니다. Apriori에서는 입력 및 출력 필드가 모두 범주형이어야 하지만 이 유형의 데이터에 최적화되어 있으므로 성능이 향상됩니다.
  • 시퀀스 노드는 순차 또는 시간 지향 데이터에서 연관 규칙을 발견합니다. 시퀀스는 예측 가능한 순서로 발생하는 경향이 있는 항목 세트의 목록입니다. 예를 들어, 면도기와 애프터쉐이브 로션을 구입하는 고객은 다음 번에 쇼핑할 때 면도 크림을 구입할 수 있습니다. 시퀀스 노드는 시퀀스를 찾기 위해 효율적인 2단계방법을 사용하는 CARMA 연관 규칙 알고리즘을 기반으로 합니다.