AutoAI 실험에서의 데이터 보충
데이터 보충이란 데이터 세트에서 누락된 값을 대체 값으로 채우는 방법을 말합니다. 대체를 사용하는 경우 데이터에서 결측값을 보간하는 방법을 지정할 수 있습니다.
실험 유형별 추정
대체 방법은 빌드하는 실험의 유형에 따라 다릅니다.
- 분류 및 회귀 분석을 위해 범주형 및 수치형 데이터의 결측치 보완 방법을 설정할 수 있습니다.
- 시계열 문제의 경우 숫자 열에 적용할 대체 방법 세트에서 선택할 수 있습니다. 실험이 실행되면, 해당 집합에서 가장 성능이 우수한 방법이 자동으로 적용됩니다. 또한 대체 값으로 특정 값을 지정할 수도 있습니다.
결측치 보완 활성화
추정 옵션을 확인하고 설정하려면:
- 실험을 설정할 때 ‘실험 설정’을 클릭하세요.
- ‘데이터 소스’ 옵션을 클릭하세요.
- ‘데이터 보충 활성화’를 클릭하세요. 데이터 보간을 명시적으로 활성화하지 않았는데도 데이터 소스에 누락된 값이 있는 경우, ` AutoAI `는 경고를 표시하고 기본 보간 방법을 적용합니다. 추정 세부 정보를 확인하세요.
- ‘결측치 보충’ 섹션에서 옵션을 선택하십시오.
- 선택적으로 데이터 열에 대해 허용 가능한 보충 비율의 임계값을 설정할 수 있습니다. 누락된 값의 백분율이 지정된 임계값을 초과하면 실험이 실패합니다. 이 문제를 해결하려면 데이터 소스를 업데이트하거나 임계값을 조정하십시오.
분류 및 회귀 실험을 위한 결측치 보완 설정
이진 분류, 다중 분류 또는 회귀 분석 실험에서 누락된 데이터를 보완하려면 다음 방법 중 하나를 선택하십시오. 텍스트 기반 (범주형) 데이터의 값을 완성하는 한 가지 방법과 숫자 데이터의 값을 완성하는 다른 방법을 사용할 수 있습니다.
| 방법 | 설명 |
|---|---|
| 가장 빈번한 | 누락된 값을 열에 가장 자주 표시되는 값으로 대체하십시오. |
| 중앙값 | 누락된 값을 정렬된 열의 중간 값으로 대체합니다. |
| 평균 | 누락된 값을 해당 열의 평균값으로 대체합니다. |
시계열 실험을 위한 결측치 보완 설정
다음 방법 중 일부 또는 전부를 선택하십시오. 여러 방법을 선택하면 최상의 수행 방법이 실험에 자동으로 적용됩니다.
참고: 날짜 또는 시간 값에 대해서는 대치가 지원되지 않습니다.
| 방법 | 설명 |
|---|---|
| 큐빅 | 누락된 값을 채우기 위해 pandas/scipy 방법을 사용하여 3차 보간을 사용합니다. |
| 채우기 | 누락된 값을 지정된 숫자 값으로 대체하려면 유형으로 ‘값’을 선택하세요. |
| 반복적 평탄화 | 먼저 데이터를 평면화한 다음, Scikit-learn의 반복적 결측치 보완기를 적용하여 결측값을 찾아냅니다. |
| 선형 | 누락된 값을 채우려면 pandas/scipy 방법을 사용하여 선형 보간법을 사용하십시오. |
| 다음 | 누락된 값을 바로 다음 값으로 대체합니다. |
| 이전 | 누락된 값을 이전 값으로 대체합니다. |