비정형 합성 데이터 생성
이 Synthetic Data Generator 서비스를 통해 귀사의 요구에 맞춰 대규모의 고품질 비정형 텍스트 데이터셋을 생성할 수 있습니다. 생성된 비정형 합성 데이터셋을 활용하여 특정 사용 사례에 맞춰 기초 모델을 튜닝하고 평가할 수 있습니다. 사용자 watsonx.ai 인터페이스와 API를 watsonx.ai 통해 서비스에 접근할 수 있습니다.
- API에 필요한 권한
- 프로젝트의 관리자 또는 편집자 역할
- IBM Cloud Identity and Access Management (IAM) 토큰
- 작업 자격 증명
- 데이터 유형
- 시드 데이터용 프로젝트 에셋으로 저장된 YAML 파일
- 일부 데이터 빌더를 위한 지식 기반으로서의 PDF 및 마크다운 파일
- 생성된 합성 데이터를 위한 JSONL
- 데이터 크기
- 임의
API 사용을 위한 인증 요구 사항
프로그래밍 방식으로 비정형 합성 데이터를 생성하려면 먼저 다음 설정을 완료해야 합니다:
프로젝트를 만들고 프로젝트에서 관리자 또는 편집자 역할을 갖습니다. 프로젝트에 연결된 Watson Machine Learning 서비스 인스턴스가 있어야 합니다.
저장소를 GitHub 사용하여 시드 데이터 및 출력과 같은 프로젝트 자산을 저장할 수 있습니다. 자세한 내용은 저장소 Git 액세스 및 기본 Git 통합이 적용된 프로젝트를 참조하십시오.
IBM Cloud 사용자 API 키를 생성하고 이를 사용하여 IBM Cloud Identity and Access Management (IAM) 토큰을 받습니다. 자세한 내용은 프로그래매틱 액세스를 위한 자격 증명을 참조하세요. IAM 토큰은 요청 본문의
Authorization헤더를 통해 전달됩니다.
기능
대규모 언어 모델(LLM)은 조직에 맞게 맞춤화된 결과물을 생성하기 위해 대규모 데이터 세트에 대한 학습이 필요합니다. 이러한 모델들은 대량의 고품질이며 정확한 훈련 데이터를 필요로 합니다. 작거나 품질이 낮은 데이터 세트는 특정 사용 사례와 관련된 출력을 생성하도록 모델을 성공적으로 학습시키기에 충분하지 않습니다.
이 Synthetic Data Generator 서비스를 사용하여 기초 모델의 튜닝 및 평가용 데이터 생성에 최적화된 데이터 빌더 및 데이터 검증기를 활용해 대규모 비정형 텍스트 데이터셋을 생성하십시오.
데이터 빌더
데이터 빌더는 사용자가 제공하는 참조 문서를 활용하여 샘플 시드 데이터를 모방하는 합성 데이터를 생성합니다. 사용 사례에 따라 다음 데이터 빌더 중에서 선택할 수 있습니다:
- 도구 호출
- 데이터 빌더를 호출하는 도구는 AI 모델을 훈련시켜 외부 도구, 애플리케이션 프로그래밍 인터페이스(API) 또는 시스템과 상호작용하여 기능을 향상시키는 데 활용할 수 있는 훈련 데이터셋을 생성합니다.
- 텍스트를 SQL로 변환
- 텍스트-SQL 데이터 빌더는 데이터베이스 작업을 설명하는 자연어 문장과 해당 데이터베이스 작업을 수행하는 동등한 SQL 문장을 포함하는 합성 SQL 데이터를 생성합니다.
- 지식
- 지식 데이터 빌더는 비즈니스 도메인에 특화된 문서 내 예시를 기반으로 질문과 답변( QnA ) 쌍을 생성합니다.
시드 데이터 형식 및 데이터 빌더 선택에 대한 자세한 내용은 데이터 빌더 및 시드 데이터 형식을 참조하십시오.
업무 방식
다음과 같은 방법으로 비정형 합성 데이터를 생성할 수 있습니다:
- 그래픽 사용자 인터페이스
- 그래픽 사용자 인터페이스를 사용하여 비정형 합성 데이터를 생성하는 작업을 생성하고 실행하십시오. 자세한 내용은 '구조화되지 않은 합성 데이터 생성을 위한 작업 생성'을 참조하십시오.
- 프로그래밍적으로
- 합성 데이터 생성(SDG) API를 사용하여 작업을 생성하고 실행합니다. 자세한 내용은 프로그래밍 방식으로 작업을 생성하여 비정형 합성 데이터를 생성하기를 참조하십시오.
합성 데이터는 watsonx.ai 에서 제공되는 파운데이션 모델을 사용하여 생성됩니다. 생성된 데이터의 형식은 사용자가 제공하는 샘플 시드 데이터와 사용하는 데이터 빌더에 기반합니다. 파운데이션 모델이 데이터셋을 생성한 후, 해당 데이터는 데이터 빌더의 품질 요구사항에 따라 검증되어 프로젝트 자산에 저장됩니다.
API 엔드포인트에 대한 자세한 내용은 watsonx.ai API 참조 문서를 참조하세요.
워크플로우
다음 다이어그램은 REST API가 비정형 합성 데이터를 생성하는 방법을 보여줍니다.