누락된 값이 있는 필드 처리

누락된 값의 대부분이 소수의 필드에 집중되어 있다면, 레코드 수준이 아닌 필드 수준에서 문제를 해결할 수 있습니다. 이 접근법은 또한 누락된 값을 처리하는 방법을 결정하기 전에 특정 필드의 상대적 중요성을 실험해 볼 수 있게 해줍니다. 모델링에서 중요하지 않은 필드는 누락된 값의 수에 관계없이 유지할 가치가 없을 것입니다.

예를 들어, 시장 조사 회사는 50개의 질문이 포함된 일반적인 설문지에서 데이터를 수집할 수 있습니다. 두 질문은 나이, 정치적 성향과 관련된 질문으로, 많은 사람들이 꺼려하는 정보입니다. 이 경우, AgePolitical_persuasion 에 많은 누락된 값이 있습니다.

현장 측정 수준

어떤 방법을 사용할지 결정할 때, 누락된 값이 있는 필드의 측정 수준도 고려해야 합니다.

숫자 필드. 숫자 필드 유형 (예: Continuous) 의 경우 숫자 필드에 공백이 포함되면 많은 모델이 작동하지 않으므로 모델을 작성하기 전에 항상 숫자가 아닌 값을 제거해야 합니다.

범주형 필드. 범주형 필드 (예: NominalFlag) 의 경우 결측값을 변경할 필요는 없지만 모델의 정확도가 높아집니다. 예를 들어, Sex 필드를 사용하는 모델은 YZ와 같은 의미 없는 값으로 계속 작동하지만 M F 이외의 모든 값을 제거하면 모델의 정확도가 증가합니다.

필드 선별 또는 제거

누락된 값이 너무 많은 필드를 걸러내기 위해 몇 가지 옵션이 있습니다:

  • 데이터 검토 노드 를 사용하여 품질을 기반으로 필드를 필터링할 수 있습니다.
  • 필드선택 노드 를 사용하여 지정된 결측값 백분율을 초과하는 필드를 선별하고 지정된 목표에 상대적인 중요도를 기준으로 필드의 순위를 지정할 수 있습니다.
  • 필드를 제거하는 대신 유형 노드 를 사용하여 필드 역할을 없음으로 설정할 수 있습니다. 이렇게 하면 데이터 세트에 있는 필드는 유지하되 모델링 프로세스에서 제외됩니다