여러 언어로 생성 AI 결과물 평가하기
watsonx.governance 에서 생성 AI 품질 모니터를 사용하여 여러 언어로 생성 AI 결과물을 평가할 수 있습니다. 평가를 구성할 때 품질 메트릭을 계산할 언어를 선택할 수 있습니다.
다국어 평가를 실행합니다:
API 또는 SDK를 사용하는 런타임에는 런타임 다국어 지원 노트북을 참조하세요.
SDK를 사용하거나 사용자 지정 토큰라이저를 사용하여 디자인할 때 디자인 시 다국어 지원 노트북을 참조하세요.
지원 언어
- 아랍어 (ar)
- 덴마크어 (da)
- 영어(en)
- 프랑스어(fr)
- 독일어(de)
- 이탈리아어(it)
- 일본어(ja)
- 한국어(ko)
- 포르투갈어 (pt)
- 스페인어(es)
참고: 가장 정확한 결과를 얻으려면 프롬프트 지침, 입력 데이터 및 생성된 출력에 동일한 언어를 사용하세요. 다른 언어를 사용하는 경우에도 평가 지표는 여전히 계산되지만 결과의 신뢰도가 떨어질 수 있습니다.
작업 유형별 지원 메트릭
- 요약
- 루즈 점수
- 코사인 유사도
- 자카드 유사도
- 정규화된 정밀도
- 정규화된 리콜
- 정규화된 F1 점수
- SARI
- METEOR
- HAP 점수
- PII 탐지
- 세대
- 루즈 점수
- 정규화된 정밀도
- 정규화된 리콜
- 정규화된 F1 점수
- METEOR
- HAP 점수
- PII 탐지
- 추출
- 정확한 일치
- 루즈 점수
- 질문 답변(QA)
- 정확한 일치
- 루즈 점수
- HAP 점수
- PII 탐지
- 검색 증강 세대(RAG)
- 루즈 점수
- 정확한 일치
- HAP 점수
- PII 탐지
사용자 인터페이스에서 평가 실행
- 프로젝트 만들기: 새 자산을 선택하고 프로젝트에서 새 프롬프트 템플릿 자산을 만든 다음, 채팅을 선택하고 Prompt Lab 사용하여 기초 모델로 프롬프트를 구축합니다.

- 프롬프트를 평가할 언어로 된 데이터로 프롬프트 템플릿 에셋을 만들고 저장합니다. 입력 변수와 샘플 입력을 추가합니다.
- 아래는 청구 요약 프롬프트 템플릿이 포함된 일본 자동차 보험의 예입니다.


- 프롬프트 템플릿 에셋을 올바른 작업 유형으로 저장합니다.


- 페이지에서 평가하기 버튼을 선택하여 평가를 시작할 수 있습니다 Prompt Lab 페이지에서 버튼을 선택합니다.

- 메트릭을 평가할 언어를 선택한 후 다음을 클릭합니다.
- 언어를 선택한 후에는 변경할 수 없습니다. 다른 언어에 대한 프롬프트 템플릿 에셋을 새로 만들어야 합니다.
- 지원되지 않는 지표는 UI에서 평가할 수 없습니다.


- 선택한 언어로 테스트 데이터 세트를 업로드하고 열 매핑을 선택합니다. 그런 다음 다음을 선택하여 선택한 언어를 확인할 수 있는 검토 및 평가 섹션으로 이동합니다.
참고: 언어 필드는 차원 선택 섹션으로 돌아가서 변경할 수 있습니다.

- 선택한 언어에 대해 선택한 메트릭을 보다 정확하게 평가하려면 평가를 클릭합니다. 평가가 완료되면 모델 요약에서 선택한 언어를 확인할 수도 있습니다.
