C & R 트리 노드

분류 및 회귀분석 (C & R) 트리 노드는 트리 기반 분류 및 예측 방법입니다. C5.0과 유사하게 이 메소드는 반복 파티셔닝을 사용하여 훈련 레코드를 유사한 출력 필드 값을 갖는 세그먼트로 분할합니다. C & R 트리 노드는 입력 필드를 검사하여 분할의 결과인 불순도 지수의 감소로 측정되는 최상의 분할을 찾는 것으로 시작합니다. 분할은 두 개의 하위 그룹을 정의하며, 각 하위 그룹은 중지 기준 중 하나가 트리거될 때까지 두 개의 하위 그룹으로 연속적으로 분할됩니다. 모든 분할은 이분형입니다 (두 개의 하위 그룹만).

프룬

C & R 트리는 먼저 트리를 성장시킨 후 터미널 노드 수를 기반으로 위험 추정값을 조정하는 비용 복잡도 알고리즘을 기반으로 제거하는 옵션을 제공합니다. 이 방법을 사용하면 더 복잡한 기준에 따라 트리를 가지치기하기 전에 트리를 크게 만들 수 있으므로 교차 검증 특성이 더 좋은 더 작은 트리가 생성될 수 있습니다. 터미널 노드의 수를 늘리면 일반적으로 현재 (훈련) 데이터에 대한 위험이 감소하지만 실제 위험은 모델이 보이지 않는 데이터로 일반화될 때 더 높을 수 있습니다. 극단적인 경우에는 훈련 세트의 각 레코드에 대해 별도의 터미널 노드가 있다고 가정합니다. 모든 레코드가 자체 노드에 속하므로 위험 추정값은 0%이지만 보이지 않는 (검정) 데이터의 오분류 위험은 거의 확실히 0보다 큽니다. 비용 복잡도 측정은 이를 보완하려고 시도합니다.

예제. 한 케이블 TV 회사가 케이블을 통해 쌍방향 뉴스 서비스에 가입할 고객을 결정하기 위해 마케팅 연구를 의뢰했습니다. 연구의 데이터를 사용하여 대상 필드가 구독을 구매하려는 의도이고 예측자 필드에 연령, 성별, 교육, 소득 카테고리, 매일 텔레비전 시청에 소요되는 시간 및 아동 수가 포함되는 플로우를 작성할 수 있습니다. 플로우에 C & R 트리 노드를 적용하면 캠페인에 대한 최고 반응률을 얻기 위해 반응을 예측하고 분류할 수 있습니다.

요구사항. C & R 트리 모델을 훈련하려면 하나 이상의 Input 필드와 정확히 하나의 Target 필드가 필요합니다. 목표 및 입력 필드는 연속형 (숫자 범위) 또는 범주형일 수 있습니다. Both 또는 None 로 설정된 필드는 무시됩니다. 모델에서 사용되는 필드에는 완전히 인스턴스화된 유형이 있어야 하며 모델에서 사용되는 서수 (정렬된 세트) 필드에는 숫자 저장 공간 (문자열이 아님) 이 있어야 합니다. 필요한 경우 재분류 노드를 사용하여 변환할 수 있습니다.

강도. C & R 트리 모델은 결측 데이터 및 많은 수의 필드와 같은 문제점이 있는 경우 매우 강력합니다. 일반적으로 예상하는 데 긴 훈련 시간이 필요하지 않습니다. 또한 C & R 트리 모델은 다른 모델 유형보다 이해하기 쉽습니다. 모델에서 파생된 규칙은 매우 간단한 해석을 갖습니다. C5.0과 달리 C & R 트리는 연속형 및 범주형 출력 필드를 포함할 수 있습니다.