배포 평가

배포 공간에서 평가를 Watson OpenScale 구성하여 모델 성능에 대한 통찰력을 얻으십시오. 평가를 구성하면 배포 공간 내에서 직접 평가 결과를 분석하고 트랜잭션 기록을 모델링할 수 있습니다.

Watson OpenScale 모델 배포를 평가하여 성능을 측정하고 모델 예측을 이해하는 데 도움을 줍니다. 모델 평가를 구성할 때, 각 평가에 대해 서로 다른 Watson OpenScale 통찰력을 제공하는 메트릭을 생성하여 검토할 수 있습니다. Watson OpenScale 또한 평가 과정에서 처리된 트랜잭션을 기록하여 모델 예측이 어떻게 결정되는지 이해하는 데 도움을 줍니다. 자세한 내용은 AI 모델 평가를 참조하십시오 Watson OpenScale.

프로비저닝된 Watson OpenScale 인스턴스가 있는 경우, 온라인 배포를 원활하게 생성한 후 배포 결과를 공정성, 품질, 드리프트 및 설명 가능성 측면에서 모니터링할 수 있습니다.

다음 그래픽은 배포 환경에서 모델을 평가하는 과정을 보여줍니다. 이 예시에서는 프로젝트의 예측 모델과 입력 데이터를 배포 공간으로 이동시키는 것부터 시작할 수 있습니다. 모델을 배포한 후 테스트 입력 데이터를 제공하여 온라인 배포를 테스트할 수 있습니다. 모델이 생성한 예측을 기반으로 공정성과 정확성에 대한 배포 결과를 모니터링하고, 배포 트랜잭션을 검토하며, 예측 정확도를 개선하기 위한 시나리오를 탐색할 수 있습니다. 제공된 평가 통찰력을 바탕으로 모델을 Watson OpenScale 업데이트할 수 있습니다.

배포 공간에서 모델 배포 평가하기

전형적인 시나리오는 다음과 같은 순서로 진행됩니다:

  1. 배포 공간을 생성하고, 해당 배포 공간에 Watson OpenScale 인스턴스를 연결하여 모든 모니터링 기능을 활성화하십시오. 요구 사항에 따라 프로덕션이나 프리프로덕션과 같은 배포 환경 유형을 선택할 수 있습니다.
  2. 훈련된 머신러닝 모델과 입력(페이로드) 데이터를 배포 공간에 배포하고 모델에 대한 온라인 배포를 생성합니다.
  3. 배포 테스트 탭에서 입력 데이터를 제공하고 예측 결과를 받아보세요.
  4. 평가 탭에서 배포의 품질, 공정성 및 설명 가능성을 모니터링하기 위한 평가를 구성하십시오. 모델에 연결하고, 훈련 및 페이로드 데이터에 접근하며, 평가 결과를 저장할 저장소에 연결할 수 Watson OpenScale 있도록 필요한 모든 모델 세부 정보를 제공하십시오.
  5. 공정성을 위한 모니터를 구성하여 모델이 편향되지 않은 결과를 생성하도록 보장하십시오. 공정성을 모니터링할 필드를 선택한 후, 기준 그룹과 비교하여 모니터링 대상 그룹의 예측을 측정할 임계값을 설정하십시오. 예를 들어, 모델을 평가하여 성별에 기반한 편향되지 않은 예측을 제공하는지 확인할 수 있습니다.
  6. 피드백 데이터라고 불리는 라벨링된 테스트 데이터를 기반으로 모델이 생성한 올바른 결과의 수를 기준으로 모델 성능을 판단하기 위해 품질 모니터를 구성합니다. 품질 임계값을 설정하여 지표 값이 허용 가능한 범위를 벗어나는 시점을 추적합니다.
  7. 모니터를 드리프트에 대해 구성하여 배포가 최신 상태이며 일관성을 유지하도록 합니다. 특징 중요도를 사용하여 모델에 대한 특징 드리프트의 영향을 판단하십시오. 예를 들어, 중요한 특징에서 발생하는 소량의 드리프트는 덜 중요한 특징에서 발생하는 중간 정도의 드리프트보다 모델에 더 큰 영향을 미칠 수 있습니다.
  8. 설명 가능성을 위해 배포 결과를 모니터링하여 모델이 예측을 결정하게 된 요인을 파악할 수 있습니다. 귀하의 요구에 가장 적합한 설명 방법을 선택하십시오. 예를 들어, 철저한 설명을 위해서는 SHAP(Shapley Additive EXplanations) 방법을, 더 빠른 설명을 위해서는 LIME(Local Interpretable Model-Agnostic Explanations) 방법을 선택할 수 있습니다.
  9. 마지막으로, 모델 평가를 검토하여 몇 가지 입력값에 대한 사소한 변경이 다른 결정을 초래할 수 있는 영역을 찾을 수 있습니다. 입력값 변경이 모델 성능을 향상시킬 수 있는지 확인하기 위한 테스트 시나리오.

Watson OpenScale 를 사용하여 배포 공간 내의 배포를 모니터링하는 방법을 확인하려면 다음 동영상을 시청하세요.

이 동영상은 본 문서의 개념과 작업을 시각적으로 학습할 수 있는 방법을 제공합니다.

다음 섹션에서는 배포 공간에서 평가를 Watson OpenScale 구성하고 모델 인사이트를 검토하는 방법을 설명합니다:

배포 환경에서 모델 평가 준비

배포 공간에서 평가를 Watson OpenScale 구성하려면 평가를 실행하기 전에 ' 서비스 인스턴스 연결' 대화 상자에서 '서비스 인스턴스 연결'을 선택해야 합니다. 평가용 연결 인스턴스 창에서 사용하려는 watsonx.governance 인스턴스를 선택하고, 프로젝트에 인스턴스를 연결하려면 '서비스 인스턴스 연결'을 선택해야 합니다. 프로젝트에 인스턴스를 연결하려면 해당 프로젝트에 관리자 역할이 할당되어야 합니다.

연관 watsonx.governance 인스턴스

인스턴스에 watsonx.governance 연결된 데이터베이스가 없는 경우, 평가 실행 전에 데이터베이스를 연결해야 합니다. 데이터베이스를 연결하려면 데이터 이스 연결 대화 상자에서 '데이터베이스 연결'을 클릭하여 데이터베이스에 연결해야 합니다. 데이터베이스를 연결하려면 프로젝트 및 watsonx.governance 인스턴스에 대해 관리자 역할이 할당되어야 합니다.

데이터베이스를 watsonx.governance 프로젝트와 연결하다

배포 공간에서 ‘ Watson OpenScale ’ 평가 구성

인스턴스를 Watson OpenScale 연결한 후에는 배포를 선택하여 평가트랜잭션 탭을 확인할 수 있습니다. 이 탭을 통해 평가를 구성하고 모델 인사이트를 검토할 수 있습니다. 배포 공간에서 모델 평가를 구성하려면 ‘ OpenScale 평가 설정 구성’을 선택하여 단계별 안내가 제공되는 마법사를 열 수 있습니다.

평가 탭에는 평가 설정을 시작하는 버튼이 표시됩니다

온라인 배포는 해당 배포 공간에서만 평가할 수 있습니다.

모델 세부 정보 제공

모델 평가를 구성하려면 모델 설정을 파악할 수 Watson OpenScale 있도록 모델 세부 정보를 제공해야 합니다. 훈련 데이터와 모델 출력에 대한 세부 정보를 제공해야 합니다.

모델 세부 정보를 제공하여 평가 설정을 구성하십시오

자세한 내용은 모델 세부 정보 제공을 참조하십시오.

설명 가능성 구성

설명 가능성을 Watson OpenScale 구성하여 모델이 특정 거래에 대해 예측한 결과에 기여하는 특징을 파악하고, 어떤 변경 사항이 다른 결과를 초래할지 예측할 수 있습니다. 로컬 설명을 구성하여 특정 모델 거래에 대한 요인의 영향을 분석하고, 글로벌 설명을 구성하여 모델 결과에 영향을 미치는 일반적인 요인을 분석할 수 있습니다.

설명 가능성 설정 구성

자세한 내용은 설명 가능성 구성을 참조하십시오.

공정성 평가 구성

공정성 평가를 구성하여 모델이 서로 다른 집단에 대해 편향된 결과를 생성하는지 여부를 판단할 수 있습니다. 공정성 평가를 구성하려면, 유리한 결과를 대표할 것으로 예상되는 기준 집단과 사용하고자 하는 공정성 지표를 지정할 수 있습니다. 참조 그룹과 비교하여 편향을 평가하기 위한 특징을 선택할 수도 있습니다.

공정성 평가 구성

자세한 내용은 공정성 평가 구성 항목을 참조하십시오.

품질 평가 구성

모델이 정확한 결과를 얼마나 잘 예측하는지 파악하기 위해 품질 평가를 구성할 수 있습니다. 품질 평가를 구성하려면 모델 품질이 저하되는 시점을 식별할 Watson OpenScale 수 있도록 각 지표에 대한 임계값을 지정해야 합니다.

품질 평가 구성

자세한 내용은 품질 평가 구성 항목을 참조하십시오.

드리프트 v2 평가 구성

시간 경과에 따른 데이터 변화를 측정하기 위해 드리프트 v2 평가를 구성하여 모델의 일관된 결과를 확보할 수 있습니다. 드리프트 v2 평가를 구성하려면 모델 출력, 예측 정확도 및 입력 데이터 분포의 변화를 식별할 Watson OpenScale 수 있도록 임계값을 설정해야 합니다. 가치 분포의 변화를 측정할 수 Watson OpenScale 있도록 중요한 특징들을 선택해야 합니다.

평가 driftv2 구성

자세한 내용은 드리프트 v2 평가 구성을 참조하십시오.

실행 평가

평가를 구성한 후 마법사를 닫아 평가를 실행할 수 있습니다. 평가를 실행하려면 평가 탭의 작업 메뉴에서 '지금 평가'를 선택하여 모델 트랜잭션을 전송해야 합니다.

평가 실행을 위한 데이터 가져오기

평가 결과 검토

평가 탭에서 평가 결과를 분석하여 모델 성능에 대한 통찰력을 얻을 수 있습니다. 평가 결과를 분석하려면 평가 섹션의 탐색 화살표 화살표를 클릭하거나 작업 메뉴를 사용하여 모델에 대한 세부 정보를 확인할 수 있습니다.

모델 배포 평가 차트가 표시되며, 각 평가 항목은 모델이 설정된 기준값을 충족하는 방식에 대한 세부 정보를 보여줍니다.

자세한 내용은 평가 결과 검토를 참조하십시오.

모델 거래 검토

모델 트랜잭션을 트랜잭션 탭에서 분석하여 모델이 결과를 예측하는 방식을 이해하고, 어떤 변경 사항이 다른 결과를 초래할 수 있는지 예측할 수 있습니다. 거래를 분석하기 위해, 모델 예측이 어떻게 결정되는지에 대한 세부 정보를 제공하는 설명을 볼 수 있습니다.

트랜잭션 세부사항

자세한 내용은 모델 거래 설명을 참조하십시오.