로지스틱 노드

로지스틱 회귀분석 ( 명목 회귀분석이라고도 함) 은 입력 필드의 값을 기준으로 레코드를 분류하는 통계 기법입니다. 이는 선형 회귀와 유사하지만 숫자 필드 대신 범주형 목표 필드를 사용합니다. 이항 모델 (이산형 범주가 두 개인 대상의 경우) 과 다항 모델 (범주가 세 개 이상인 대상의 경우) 모두 지원됩니다.

로지스틱 회귀분석은 입력 필드 값을 각 출력 필드 범주와 연관된 확률과 관련시키는 방정식 세트를 작성하여 작동합니다. 모델이 생성된 후 이를 사용하여 새 데이터에 대한 확률을 추정할 수 있습니다. 각 레코드에 대해 가능한 각 출력 범주에 대해 멤버십 확률이 계산됩니다. 확률이 가장 높은 대상 범주가 해당 레코드의 예측 출력 값으로 지정됩니다.

이항 예. 통신 제공업체는 경쟁사에 빼앗기고 있는 고객 수에 대해 우려하고 있습니다. 서비스 사용 데이터를 사용하여 이항 모델을 작성하여 다른 제공자에게 전송할 책임이 있는 고객을 예측하고 가능한 많은 고객을 유지할 수 있도록 오퍼를 사용자 정의할 수 있습니다. 대상에 두 개의 고유한 범주 (전송 가능성이 있거나 없음) 가 있으므로 이항 모델이 사용됩니다.

참고: 이항 모델의 경우에만 문자열 필드가 8자로 제한됩니다. 필요한 경우 재분류 노드를 사용하거나 익명화 노드를 사용하여 더 긴 문자열을 코딩변경할 수 있습니다.

다항 예. 통신 제공업체는 고객을 네 개의 그룹으로 분류하여 서비스 사용 패턴별로 고객 기반을 세그먼트화했습니다. 인구 통계 데이터를 사용하여 그룹 멤버십을 예측하면 다항 모델을 작성하여 잠재 고객을 그룹으로 분류한 다음 개별 고객에 대한 오퍼를 사용자 정의할 수 있습니다.

요구사항. 둘 이상의 범주가 있는 하나 이상의 입력 필드 및 정확히 하나의 범주형 목표 필드. 이항 모델의 경우 대상의 측정 수준은 Flag이어야 합니다. 다항 모델의 경우 대상의 측정 수준은 Flag또는 둘 이상의 범주가 있는 Nominal 일 수 있습니다. Both 또는 None 로 설정된 필드는 무시됩니다. 모델에서 사용되는 필드의 유형은 완전히 인스턴스화되어야 합니다.

강도. 로지스틱 회귀 모형은 종종 매우 정확합니다. 기호 및 숫자 입력 필드를 처리할 수 있습니다. 두 번째 최상의 추측을 쉽게 식별할 수 있도록 모든 대상 범주에 대한 예측 확률을 제공할 수 있습니다. 로지스틱 모델은 그룹 멤버십이 실제 범주형 필드일 때 가장 효과적입니다. 그룹 멤버십이 연속형 범위 필드의 값을 기반으로 하는 경우 (예: 높은 IQ대 낮은 IQ) 전체 값 범위에서 제공하는 풍부한 정보를 활용하기 위해 선형 회귀를 사용하는 것을 고려해야 합니다. 로지스틱 모델은 자동 필드 선택을 수행할 수도 있지만 트리 모델이나 필드선택과 같은 다른 접근 방식은 대형 데이터 세트에서 더 빠르게 이를 수행할 수 있습니다. 마지막으로, 로지스틱 모델은 많은 분석가 및 데이터 마이너에 의해 잘 이해되기 때문에 일부 모델은 다른 모델링 기술과 비교할 수 있는 기준선으로 사용될 수 있습니다.

대형 데이터 세트를 처리할 때 고급 출력 옵션인 우도비 검정을 사용 안함으로 설정하여 성능을 현저하게 향상시킬 수 있습니다.