평가 차트
평가 차트는 히스토그램이나 집합 그래프와 유사합니다. 평가 차트는 모델이 특정 결과를 예측하는 데 얼마나 정확한지를 보여줍니다. 이들은 예측값과 예측 신뢰도를 기준으로 기록을 정렬하고, 기록을 동일한 크기의 그룹(분위수)으로 분할한 후, 각 분위수에 대해 기준값을 높은 순서에서 낮은 순서로 플롯하는 방식으로 작동합니다. 여러 모델이 플롯에서 별도의 선으로 표시됩니다.
결과는 특정 값 또는 값의 범위를 "히트"로 정의함으로써 처리됩니다. 히트는 일반적으로 어떤 형태의 성공(예: 고객에 대한 판매)이나 관심 대상 사건(예: 특정 의학적 진단)을 나타냅니다.
- 플래그
- 출력 필드는 간단합니다; 히트는 값에
true대응합니다. - 명목상
- 명목 출력 필드의 경우, 집합의 첫 번째 값이 일치를 정의합니다.
- 연속형
- 연속형 출력 필드의 경우, 히트는 필드 범위의 중간값보다 큰 값과 일치합니다.
평가표는 누적형으로도 작성될 수 있어, 각 점이 해당 분위수의 값과 그보다 높은 모든 분위수의 값을 합한 값과 같게 됩니다. 누적 차트는 일반적으로 모델의 전반적인 성능을 더 잘 전달하는 반면, 비누적 차트는 종종 모델의 특정 문제 영역을 나타내는 데 탁월합니다.
간단한 평가 차트 만들기
- 차트 유형 섹션에서 평가 아이콘을 클릭하십시오.
캔버스가 업데이트되어 평가 차트 템플릿을 표시합니다.
- 대상 필드, 예측 필드 및 신뢰도 필드 변수를 설정하십시오. 대상 필드는 두 개 이상의 값을 가지는 인스턴스화된 플래그 또는 명목 필드일 수 있습니다. 예측 필드는 예측값으로 사용되는 변수를 정의합니다. 신뢰도 필드는 예측의 신뢰도를 확립하는 데 사용되는 변수를 정의합니다.참고: 예측 필드의 변수 유형은 대상 필드에 선택된 변수 유형과 일치해야 합니다.
- 사용자 정의 히트를 나타내는 데 사용되는 사용자 정의 조건을 지정하십시오. 이 옵션은 관심 있는 결과를 정의하는 데 유용하며, 대상 필드의 유형과 값의 순서로부터 이를 추론하는 대신 사용됩니다.
히트 조건에 대해 CLEM 표현식을 지정해야 합니다. 예를 들어,
@TARGET = "YES"는 대상 필드의Yes값이 평가에서 히트로 집계됨을 나타내는 유효한 조건입니다. 지정된 조건은 모든 대상 필드에 적용됩니다. - 프로젝트 컨트롤에서 시각화 저장을 클릭하세요. 새 자산을 생성하거나 기존 자산에 추가를 선택하십시오. 시각화 자산 이름, 선택적 설명 및 차트 이름을 입력하십시오.
- '적용'을 클릭하여 시각화를 프로젝트에 저장하십시오. 새로운 시각화 자산이 이제 자산 탭에서 이용 가능합니다.
옵션
- 대상 필드
- 두 개 이상의 값을 가진 플래그 또는 명목형 필드 변수를 인스턴스화한 목록입니다.
- 사용자 정의 히트
- 타격 값을 지정하십시오. 히트는 관심 대상 사건(예: 특정 의학적 진단)을 나타냅니다.
- 예측 필드
- 예측값으로 사용할 수 있는 변수 목록입니다.
- 신뢰 영역
- 예측의 신뢰도를 확립할 수 있는 변수들을 나열합니다.
- 누적 플롯
- 활성화 시 누적 차트를 생성합니다. 누적 차트의 값은 각 사분위수와 그보다 높은 모든 사분위수에 대해 표시됩니다.
- 표시 모드
- 설정은 미리 보기 모드와 출력에서 표시되는 차트를 제어합니다.
- 단일 모드
- 선택 시 모델 분류 튜닝 차트는 미리 보기 모드와 출력에서 표시되는 유일한 차트입니다.
- 클래식 모드
- 선택 시 모델 분류 튜닝, 커트오프, 매트릭스 바, ROC, 게인, ROI 및 이익 차트가 미리 보기 모드와 출력에 표시됩니다.
- 전체 모드
- 선택 시 모델 분류 튜닝, 컷오프, 매트릭스 바, ROC, 게인, ROI, 이익, 지니 계수, 리프트 및 응답 차트가 미리 보기 모드와 출력에 표시됩니다.
- 평가 차트
- 차단 장치
- 절단점 차트는 지정된 절단값에 대해 선택된 변수의 예측값과 실제값을 보여줍니다.
- 매트릭스 바
- 매트릭스 막대형 차트는 여러 변수 간에 선형 상관관계가 존재하는지 판단하는 데 유용한 방법이다.
- ROC
- ROC(수신자 작동 특성)은 두 범주로 구분되는 한 변수에 대해 대상이 분류되는 분류 체계의 성능을 평가합니다.
- 이익
- 이득은 각 사분위수에서 발생하는 총 히트 수의 비율로 정의된다. 이익은 다음과 같이
(number of hits in quantile / total number of hits) × 100%계산됩니다. - ROI
- ROI(투자 수익률)은 수익과 비용을 정의하는 점에서 이익과 유사합니다. ROI는 해당 분위수에 대한 이익과 비용을 비교합니다. ROI는 다음과 같이
(profits for quantile / costs for quantile) × 100%계산됩니다. - 이익
- 이익은 각 레코드의 수익에서 해당 레코드의 비용을 뺀 값과 같습니다. 분위수별 이익은 해당 분위수에 속하는 모든 기록의 이익을 합산한 값이다. 수익은 히트에만 적용되는 것으로 가정되지만, 비용은 모든 레코드에 적용됩니다. 이익과 비용은 고정될 수도 있고 데이터의 필드에 의해 정의될 수도 있습니다. 이익은 (분위수 내 기록들의 수익 합계 - 분위수 내 기록들의 비용 합계)로 계산됩니다.
- Kolmogorov-Smirnov
- 관측된 변수의 누적 분포 함수를 지정된 이론적 분포(정규, 균일, 지수 또는 포아송 분포)와 비교합니다.
- 지니
- 지니계수는 통계적 분산을 측정하며 소득 또는 부의 분포를 나타내기 위한 지표이다. 이는 불평등을 측정하는 데 가장 흔히 사용되는 지표이다.
- Lift
- 리프트는 훈련 데이터에서 히트 기록의 전체 비율과 각 사분위수 내 히트 기록의 비율을 비교합니다. 다음과 같이
(hits in quantile / records in quantile) / (total hits / total records)계산됩니다. - 응답
- 응답률은 해당 분위수 내 기록 중 일치하는 기록의 비율입니다. 응답은 다음과 같이
(hits in quantile / records in quantile) × 100%계산됩니다.
- 평가 차트 설정
- 다음 설정은 수익 및 ROI 차트에만 적용됩니다.
- 비용
- 각 레코드와 관련된 고정 비용을 지정하십시오.
- 수익
- 각 히트를 나타내는 레코드와 연관된 고정 수익을 명시하십시오.
- 가중치
- 데이터의 기록이 하나 이상의 단위를 나타내는 경우, 빈도 가중치를 사용하여 결과를 조정할 수 있습니다. 각 레코드에 할당된 고정 가중치를 지정하십시오.