입력 데이터 문자열 길이 줄이기

이 튜토리얼은 입력 데이터 문자열 길이를 줄여야 할 수 있는 경우의 예를 제공합니다. 이항 로지스틱 회귀분석 및 이항 로지스틱 회귀분석 모델을 포함하는 자동 분류자 모델의 경우 문자열 필드는 최대 8자로 제한됩니다. 문자열이 8자 이상인 경우, 재분류 노드를 사용하여 이를 재코딩할 수 있습니다.

이 예시는 흐름의 일부를 집중적으로 다루어 지나치게 긴 문자열로 인해 발생할 수 있는 오류 유형을 보여주고, 재분류 노드를 사용하여 문자열 세부 정보를 허용 가능한 길이로 변경하는 방법을 설명합니다. 이 예제에서는 이항 로지스틱 회귀 노드를 사용하지만, 자동 분류기 노드를 사용하여 이항 로지스틱 회귀 모델을 생성할 수도 있습니다.

튜토리얼 미리보기

비디오 보기 이 튜토리얼의 단계를 미리 보려면 이 동영상을 시청하세요. 동영상에 표시된 사용자 인터페이스에는 약간의 차이가 있을 수 있습니다. 이 동영상은 서면 튜토리얼을 보완하기 위한 것입니다. 이 동영상은 본 문서의 개념과 작업을 시각적으로 학습할 수 있는 방법을 제공합니다.

튜토리얼을 시도해 보세요

이 튜토리얼에서는 다음 작업을 완료하게 됩니다:

샘플 모델러 흐름 및 데이터 세트

이 튜토리얼은 샘플 프로젝트의 입력 데이터 문자열 길이 줄이기 흐름을 사용합니다. 사용된 데이터 파일은. drug_long_name.csv 입니다. 다음 이미지는 샘플 모델러 흐름을 보여줍니다.

그림 1. 샘플 모델러 흐름
이항 로지스틱 회귀 분석을 위한 문자열 재분류 예시 흐름도
다음 이미지는 샘플 데이터 세트를 보여줍니다.
그림 2. 샘플 데이터 세트
샘플 데이터 세트

작업 1: 샘플 프로젝트 열기

샘플 프로젝트에는 여러 데이터 세트와 샘플 모델러 흐름이 포함되어 있습니다. 샘플 프로젝트가 아직 없다면, 튜토리얼 항목을 참조하여 샘플 프로젝트를 생성하십시오. 그런 다음 다음 단계를 따라 샘플 프로젝트를 엽니다:

  1. 에서 watsonx 탐색 메뉴에서 프로젝트 탐색 메뉴 > 모든 프로젝트를 선택합니다.
  2. SPSS Modeler 프로젝트를 클릭하세요.
  3. 자산 탭을 클릭하면 데이터 세트와 모델러 흐름을 볼 수 있습니다.

체크포인트 아이콘 진행 상황을 확인하세요

다음 이미지는 프로젝트의 '자산' 탭을 보여줍니다. 이제 이 튜토리얼과 관련된 샘플 모델러 흐름을 사용할 준비가 되었습니다.

샘플 프로젝트

맨 위로

작업 2: 데이터 자산 및 유형 노드 검토

입력 데이터 문자열 길이 줄이기는 여러 노드를 포함합니다. 다음 단계를 따라 데이터 자산유형 노드를 확인하십시오:

  1. 자산 탭에서 입력 데이터 문자열 길이 줄이기 모델러 흐름을 열고 캔버스가 로드될 때까지 기다립니다.
  2. 노드를 drug_long_name.csv 두 번 클릭하십시오. 이 노드는 프로젝트 내 파일로 drug_long_name.csv 연결되는 데이터 자산 노드입니다.
  3. 파일 형식 속성을 검토하십시오.
  4. 선택 사항: 전체 데이터 세트를 보려면 데이터 미리 보기를 클릭하세요.
  5. 데이터 자산 노드 뒤에 있는 유형 노드를 두 번 클릭하십시오. 이 노드는 측정 수준(필드가 포함하는 데이터 유형)과 같은 필드 속성 및 모델링에서 각 필드의 대상 또는 입력 역할 등을 지정합니다. 측정 수준은 필드 내 데이터의 유형을 나타내는 범주입니다. 원본 데이터 파일은 세 가지 다른 측정 수준을 사용합니다:
    • 연속형 필드(예: 필드) Age 는 연속적인 숫자 값을 포함합니다.
    • 명목형 필드(예: 필드 Drug )는 두 개 이상의 서로 다른 값을 가집니다. 이 경우, drugA 또는 drugB입니다.
    • 플래그 필드(예: 필드 Sex )는 고유한 순서를 지닌 여러 개의 서로 다른 값을 가진 데이터를 설명합니다. 이 경우, F, 그리고 M입니다.
    그림 3. 노드 속성 입력
    타입 노드

    각 필드에 대해 Type 노드는 모델링에서 각 필드가 수행하는 역할을 나타내기 위한 역할도 지정합니다. 역할해당 필드의 대상으로 Cholesterol_long설정되어 있으며, 이 필드는 고객의 콜레스테롤 수치가 정상 수준인지 높은 수준인지를 나타냅니다. 상은 값을 예측하고자 하는 필드입니다.

    다른 필드에 대해 역할이 입력 으로 설정됩니다. 입력 필드는 때때로 예측 변수라고도 불리며, 모델링 알고리즘이 대상 필드의 값을 예측하는 데 사용되는 값을 지닌 필드입니다.

  6. 선택 사항: 필터링된 데이터 세트를 보려면 데이터 미리 보기를 클릭하세요.

체크포인트 아이콘 진행 상황을 확인하세요

다음 이미지는 Type 노드를 보여줍니다. 이제 로지스틱 노드를 볼 준비가 되었습니다.

타입 노드

맨 위로

작업 3: 값 재분류

이 작업에서 모델을 실행한 후 오류를 발견한 경우, 오류를 방지하기 위해 다음 단계를 따라 값을 재분류하십시오:

  1. 패널의 모델링 섹션에서 로지스틱 노드를 캔버스로 드래그한 후, 데이터 자산 노드 다음에 위치한 기존 유형 노드에 연결합니다.
  2. 콜레스테롤_long 노드를 더블 클릭하여 속성을 확인하십시오.
  3. 이항 절차(기본값인 다항 절차 대신)를 선택하십시오.
    • 이항 모델은 대상 필드가 두 개의 이산 값을 가지는 플래그 또는 명목형 필드일 때 사용됩니다.
    • 다항 모델은 대상 필드가 두 개 이상의 값을 가지는 명목형 필드일 때 사용됩니다.
  4. 저장을 클릭하십시오.
  5. 콜레스테롤_long 노드 위에 마우스를 올려놓고 실행 아이콘을 클릭하세요 실행 아이콘. 오류 메시지가 문자열 Cholesterol_long 값이 너무 길다고 경고합니다. 이 문제를 해결하려면 재분류 노드를 사용하여 값을 변환할 수 있습니다. 노드 재분류 기능은 범주를 접거나 분석을 위해 데이터를 재구성하는 데 유용합니다.
    그림 4. 알림
    오류 메시지
  6. 콜레스테롤(재분류) 노드를 더블클릭하여 속성을 확인하십시오. 재분류 필드가 로 설정되어 Cholesterol_long 있으며 새 필드 이름은 입니다 Cholesterol.
  7. 값 가져오기를 클릭한 다음 자동 재분류 섹션을 확장합니다. 값들을 Cholesterol_long 원래 값 열에 추가하십시오.
  8. 새로운 값 열에서, 고콜레스테롤 수치 원본 값에는 를 입력하고 High , 정상 콜레스테롤 수치 원본 값에는 를 입력하십시오 Normal. 이러한 설정은 오류 메시지를 피하기 위해 값을 줄입니다.

체크포인트 아이콘 진행 상황을 확인하세요

다음 이미지는 재분류 노드를 보여줍니다. 이제 필터 노드를 확인할 준비가 되었습니다.

노드 속성 재분류

맨 위로

작업 4: 필터 노드 확인

필터 노드를 확인하려면 다음 단계를 따르십시오:

  1. 필터 노드를 더블 클릭하여 속성을 확인하십시오.
  2. 이 노드가 필드(field) Cholesterol_long 를 걸러낸다는 점에 유의하십시오.

체크포인트 아이콘 진행 상황을 확인하세요

다음 이미지는 필터 노드를 보여줍니다. 이제 목표를 정의할 준비가 되었습니다.

필터 노드 속성

맨 위로

과제 5: 목표 정의

타입 노드에서 필드 속성을 지정할 수 있습니다. 타입 노드에서 대상을 정의하려면 다음 단계를 따르십시오:

  1. 필터 노드 뒤에 있는 유형 노드를 더블클릭하여 해당 속성을 확인하십시오.
  2. 값 읽기를 클릭하여 데이터 소스에서 값을 읽고 필드 측정 유형을 설정하십시오. 역할은 머신러닝 프로세스에서 필드가 입력 (예측 변수)인지 목표 (예측 변수)인지 모델링 노드에 알려줍니다. '둘 다'와 '아무것도 아님'도 사용 가능한 역할이며, '분할' 역할은 훈련, 테스트, 검증용으로 레코드를 별도의 샘플로 분할하는 데 사용되는 필드를 나타냅니다. Split 값은 필드의 가능한 각 값에 대해 별도의 모델을 구축하도록 지정합니다.
  3. 콜레스테롤 필드의 역할을 대상으로 설정하십시오.
  4. 저장을 클릭하십시오.

체크포인트 아이콘 진행 상황을 확인하세요

다음 이미지는 Type 노드를 보여줍니다. 이제 모델을 생성할 준비가 되었습니다.

타입 노드 대상

맨 위로

작업 6: 모델 생성

모델 출력을 표 형식으로 보려면 다음 단계를 따르십시오:

  1. 콜레스테롤(로지스틱) 노드 위에 마우스를 올린 후 실행 아이콘을 클릭하세요 실행 아이콘.
  2. 팔레트의 출력 (Outputs) 섹션에서 테이블(Table) 노드를 캔버스로 드래그한 후 모델 너겟(model nugget)에 연결하십시오.
  3. 콜레스테롤 모델에 연결된 테이블 노드 위에 마우스를 올려놓고 실행 아이콘을 클릭하세요 실행 아이콘.
  4. 출력 및 모델 창에서 '테이블'이라는 이름의 출력 결과를 클릭하여 테이블 출력을 확인하십시오.

체크포인트 아이콘 진행 상황을 확인하세요

다음 이미지는 모델 출력을 보여줍니다.

모델 출력

맨 위로

요약

이 예시는 지나치게 긴 문자열로 인해 발생할 수 있는 오류 유형을 보여주었으며, 재분류 노드를 사용하여 문자열 세부 정보를 허용 가능한 길이로 변경하는 방법을 설명합니다. 비록 예제에서는 이항 로지스틱 회귀 노드를 사용하지만, 자동 분류기 노드를 사용하여 이항 로지스틱 회귀 모델을 생성할 때도 동일하게 적용됩니다.

다음 단계

이제 다른 SPSS® Modeler 튜토리얼을 시도할 준비가 되었습니다.