C5.0 노드

이 노드는 C5.0 알고리즘을 사용하여 의사결정 트리 또는 규칙 세트를 빌드합니다. C5.0 모델은 최대 정보 이득을 제공하는 필드를 기반으로 샘플을 분할하여 작동합니다. 첫 번째 분할에 의해 정의된 각 하위 표본은 일반적으로 다른 필드를 기반으로 다시 분할되며 하위 표본을 더 이상 분할할 수 없을 때까지 프로세스가 반복됩니다. 마지막으로 가장 낮은 수준의 분할을 다시 검사하고 모델 값에 크게 기여하지 않는 분할은 제거되거나 가지치기됩니다.

참고: C5.0 노드는 범주형 목표만 예측할 수 있습니다. 범주형 (명목 또는 순서) 필드를 사용하여 데이터를 분석할 때 노드는 범주를 함께 그룹화할 수 있습니다.

C5.0 은 두 종류의 모델을 생성할 수 있습니다. 의사결정 트리 는 알고리즘에서 찾은 분할에 대한 간단한 설명입니다. 각 터미널 (또는 "리프") 노드는 훈련 데이터의 특정 서브세트를 설명하며 훈련 데이터의 각 케이스는 트리에서 정확히 하나의 터미널 노드에 속합니다. 즉, 의사결정 트리에 표시되는 특정 데이터 레코드에 대해 정확히 하나의 예측이 가능합니다.

반대로, 규칙 세트 는 개별 레코드에 대한 예측을 시도하는 규칙 세트입니다. 규칙 세트는 의사결정 트리에서 파생되며, 어떤 방식으로 의사결정 트리에서 찾은 정보의 단순화되거나 정제된 버전을 나타냅니다. 규칙 세트는 종종 전체 의사결정 트리에서 중요한 정보의 대부분을 보유할 수 있지만 덜 복잡한 모델을 사용합니다. 규칙 세트가 작동하는 방식으로 인해 의사결정 트리와 동일한 특성을 갖지 않습니다. 가장 중요한 차이점은 규칙 세트를 사용하면 특정 레코드에 대해 둘 이상의 규칙이 적용되거나 규칙이 전혀 적용되지 않을 수 있다는 점입니다. 여러 규칙이 적용되는 경우 각 규칙은 해당 규칙과 연관된 신뢰도를 기반으로 가중된 "투표" 를 받으며 최종 예측은 해당 레코드에 적용되는 모든 규칙의 가중된 투표를 결합하여 결정됩니다. 규칙이 적용되지 않으면 기본 예측이 레코드에 지정됩니다.

예제. 한 의학 연구원이 한 세트의 환자들에 대한 데이터를 수집했는데, 그들 모두가 같은 병을 앓고 있었다. 그들의 치료 과정 동안, 각각의 환자는 5개의 약물 중 하나에 반응했습니다. 다른 노드와 함께 C5.0 모델을 사용하여 동일한 질병을 가진 향후 환자에게 적합한 약물을 찾을 수 있습니다.

요구사항. C5.0 모델을 훈련하려면 하나의 범주형 (예: 명목 또는 순서) Target 필드와 임의 유형의 하나 이상의 Input 필드가 있어야 합니다. Both 또는 None 로 설정된 필드는 무시됩니다. 모델에서 사용되는 필드의 유형은 완전히 인스턴스화되어야 합니다. 가중치 필드도 지정할 수 있습니다.

강도. C5.0 모델은 누락된 데이터 및 많은 수의 입력 필드와 같은 문제점이 있을 때 매우 강력합니다. 일반적으로 예상하는 데 긴 훈련 시간이 필요하지 않습니다. 또한 모델에서 파생된 규칙은 매우 간단한 해석을 갖기 때문에 C5.0 모델은 일부 다른 모델 유형보다 이해하기 쉬운 경향이 있습니다. C5.0 은 또한 분류의 정확도를 높이기 위해 강력한 부스팅 방법을 제공합니다.

팁: C5.0 모델 작성 속도는 병렬 처리를 사용하는 것이 좋습니다.
참고: 플로우를 처음 작성할 때 사용할 런타임을 선택합니다. 기본적으로 플로우는 IBM SPSS Modeler 런타임을 사용합니다. SPSS 알고리즘 대신 원시 Spark 알고리즘을 사용하려면 Spark 런타임을 선택하십시오. 이 노드의 특성은 선택하는 런타임 옵션에 따라 다릅니다.