누락된 값이 있는 필드 처리
누락된 값의 대부분이 소수의 필드에 집중되어 있다면, 레코드 수준이 아닌 필드 수준에서 문제를 해결할 수 있습니다. 이 접근법은 또한 누락된 값을 처리하는 방법을 결정하기 전에 특정 필드의 상대적 중요성을 실험해 볼 수 있게 해줍니다. 모델링에서 중요하지 않은 필드는 누락된 값의 수에 관계없이 유지할 가치가 없을 것입니다.
예를 들어, 시장 조사 회사는 50개의 질문이 포함된 일반적인 설문지에서 데이터를 수집할 수 있습니다. 두 질문은 나이, 정치적 성향과 관련된 질문으로, 많은 사람들이 꺼려하는 정보입니다. 이 경우, Age 와 Political_persuasion 에 많은 누락된 값이 있습니다.
현장 측정 수준
어떤 방법을 사용할지 결정할 때, 누락된 값이 있는 필드의 측정 수준도 고려해야 합니다.
숫자 필드. 숫자 필드 유형 (예: Continuous) 의 경우 숫자 필드에 공백이 포함되면 많은 모델이 작동하지 않으므로 모델을 작성하기 전에 항상 숫자가 아닌 값을 제거해야 합니다.
범주형 필드. 범주형 필드 (예: Nominal 및 Flag) 의 경우 결측값을 변경할 필요는 없지만 모델의 정확도가 높아집니다. 예를 들어, Sex 필드를 사용하는 모델은 Y 및 Z와 같은 의미 없는 값으로 계속 작동하지만 M 및 F 이외의 모든 값을 제거하면 모델의 정확도가 증가합니다.
필드 선별 또는 제거
누락된 값이 너무 많은 필드를 걸러내기 위해 몇 가지 옵션이 있습니다: