Data Refinery 에서 HDFS 데이터 정제하기

Hadoop 클러스터 내의 Hadoop 분산 파일 시스템( HDFS )에 대한 데이터를 정제합니다.

필수 소프트웨어

Hadoop 클러스터에 연결을 설정합니다. HDFS via Execution Engine for Hadoop 연결을 참조하십시오.

제한사항

Data Refinery 의 소스 및 대상과 Hadoop 환경 은 모두 동일한 Hadoop 시스템을 참조해야 합니다.

Hadoop 클러스터에서 Data Refinery 작업을 실행하려면 Hadoop 환경을 사용해야 합니다.

프로시저

  1. HDFS via Execution Engine for Hadoop 연결에서 데이터를 추가합니다. “ Data Refinery 에 데이터 추가 ”를 참조하십시오.
  2. 데이터에 연산을 적용하여 ‘ Data Refinery ’ 흐름을 생성합니다:
  3. Data Refinery 워크플로를 저장하고, Hadoop 환경에서 해당 워크플로에 대한 작업을 실행합니다. “ Data Refinery ” 흐름 관리 항목을 참조하십시오.
    대상 출력으로는 ‘ HDFS via Execution Engine for Hadoop ’ 연결을 사용하거나, ‘ HDFS via Execution Engine for Hadoop ’ 연결을 통해 연결된 데이터 자산을 사용할 수 있습니다.
    중요: 출력 파일의 파일 형식을 반드시 지정해야 합니다.

알려진 문제

Hadoop 환경 문제 해결

자세히 알아보기