AutoAI 실험에서의 데이터 보충

데이터 보충이란 데이터 세트에서 누락된 값을 대체 값으로 채우는 방법을 말합니다. 대체를 사용하는 경우 데이터에서 결측값을 보간하는 방법을 지정할 수 있습니다.

실험 유형별 추정

대체 방법은 빌드하는 실험의 유형에 따라 다릅니다.

  • 분류 및 회귀 분석을 위해 범주형 및 수치형 데이터의 결측치 보완 방법을 설정할 수 있습니다.
  • 시계열 문제의 경우 숫자 열에 적용할 대체 방법 세트에서 선택할 수 있습니다. 실험이 실행되면, 해당 집합에서 가장 성능이 우수한 방법이 자동으로 적용됩니다. 또한 대체 값으로 특정 값을 지정할 수도 있습니다.

결측치 보완 활성화

추정 옵션을 확인하고 설정하려면:

  1. 실험을 설정할 때 ‘실험 설정’을 클릭하세요.
  2. ‘데이터 소스’ 옵션을 클릭하세요.
  3. ‘데이터 보충 활성화’를 클릭하세요. 데이터 보간을 명시적으로 활성화하지 않았는데도 데이터 소스에 누락된 값이 있는 경우, ` AutoAI `는 경고를 표시하고 기본 보간 방법을 적용합니다. 추정 세부 정보를 확인하세요.
  4. ‘결측치 보충’ 섹션에서 옵션을 선택하십시오.
  5. 선택적으로 데이터 열에 대해 허용 가능한 보충 비율의 임계값을 설정할 수 있습니다. 누락된 값의 백분율이 지정된 임계값을 초과하면 실험이 실패합니다. 이 문제를 해결하려면 데이터 소스를 업데이트하거나 임계값을 조정하십시오.

분류 및 회귀 실험을 위한 결측치 보완 설정

이진 분류, 다중 분류 또는 회귀 분석 실험에서 누락된 데이터를 보완하려면 다음 방법 중 하나를 선택하십시오. 텍스트 기반 (범주형) 데이터의 값을 완성하는 한 가지 방법과 숫자 데이터의 값을 완성하는 다른 방법을 사용할 수 있습니다.

방법 설명
가장 빈번한 누락된 값을 열에 가장 자주 표시되는 값으로 대체하십시오.
중앙값 누락된 값을 정렬된 열의 중간 값으로 대체합니다.
평균 누락된 값을 해당 열의 평균값으로 대체합니다.

시계열 실험을 위한 결측치 보완 설정

다음 방법 중 일부 또는 전부를 선택하십시오. 여러 방법을 선택하면 최상의 수행 방법이 실험에 자동으로 적용됩니다.

참고: 날짜 또는 시간 값에 대해서는 대치가 지원되지 않습니다.
방법 설명
큐빅 누락된 값을 채우기 위해 pandas/scipy 방법을 사용하여 3차 보간을 사용합니다.
채우기 누락된 값을 지정된 숫자 값으로 대체하려면 유형으로 ‘값’을 선택하세요.
반복적 평탄화 먼저 데이터를 평면화한 다음, Scikit-learn의 반복적 결측치 보완기를 적용하여 결측값을 찾아냅니다.
선형 누락된 값을 채우려면 pandas/scipy 방법을 사용하여 선형 보간법을 사용하십시오.
다음 누락된 값을 바로 다음 값으로 대체합니다.
이전 누락된 값을 이전 값으로 대체합니다.

다음 단계

시계열 실험을 위한 데이터 보충 구현 세부 사항