조정된 모델 배포

모델을 특정 작업, 데이터셋 또는 사용 사례에 맞게 조정할 수 있습니다. 튜닝 과정은 사전 훈련된 모델의 매개변수 또는 가중치를 조정하여 모델의 성능과 정확도를 향상시킵니다. 최적화된 모델을 배포하여 비즈니스 워크플로에 추가하고, 파운데이션 모델을 실질적으로 활용할 수 있도록 하십시오.

다음 기법 중 하나로 튜닝된 파운데이션 모델을 배포할 수 있습니다:

  • 완벽한 미세 조정
  • 저순위 적응( LoRA ) 미세 조정
  • 양자화된 저랭크 적응( QLoRA ) 미세 조정

일하는 방법

여러분은 튜닝된 파운데이션을 배포하기 위해 다음과 같은 다양한 방법을 사용합니다:

요구사항

조정된 모델을 배포하기 전에 다음 작업을 완료해야 합니다:

  1. Tuning Studio 을 사용하거나 프로그래밍 방식으로 파운데이션 모델을 튜닝합니다. 자세한 내용은 파운데이션 모델 튜닝을 참조하십시오.

  2. LoRA 또는 QLoRA 에서 미세 조정된 모델 전용: LoRA 또는 QLoRA, 에서 조정된 모델 배포 요건을 검토하십시오. 여기에는 지원되는 모델, 하드웨어 및 소프트웨어 요구 사항, 배포 유형이 포함됩니다. 자세한 내용은 LoRA 또는 QLoRA 튜닝 모델 배포 요건을 참조하십시오.

워크플로우

어떤 방식으로 작업하든, 튜닝된 파운데이션 모델을 배포하는 고수준 워크플로는 동일하게 유지됩니다. 최적화된 모델 배포에는 다음 작업이 포함됩니다:

  1. 선택 사항: 모델을 튜닝할 때 자산이 자동으로 생성되지 않은 경우, 튜닝된 파운데이션 모델용 저장소 자산을 생성합니다.
  2. 조정된 모델 자산을 배포합니다.
  3. 조정된 모델의 배포를 추론하여 조정된 기초 모델이 텍스트 입력에 대해 어떻게 반응하는지 테스트합니다.
  4. 조정된 모델 배포에 대한 엔드포인트 URL 를 가져옵니다. 이 엔드포인트를 사용하여 애플리케이션에서 배포에 접근할 수 있습니다. 프로젝트 또는 배포 공간의 '배포' 탭에서 배포 이름을 클릭하세요. API 참조 탭에서 애플리케이션에 엔드포인트 세부 정보를 포함하는 데 사용할 수 있는 비공개 및 공개 엔드포인트 링크와 코드 스니펫을 찾으십시오.

자세히 알아보기