IBM, 새로운 모델 위험 평가 엔진으로 watsonx.governance 기능 강화

왼쪽의 화려한 들판과 오른쪽의 나무가 늘어선 도로를 두 대의 자동차가 달리는 조감도

작성자

Marc Cassagnol

Product Manager, watsonx.governance

IBM

Michael Hind

Distinguished Research Staff Member

IBM

watsonx.governance의 새로운 도구인 Model Risk Evaluation Engine을 발표하게 되어 기쁘게 생각합니다. 이 도구는 AI Risk Atlas의 위험 차원 관련 지표를 계산하여 파운데이션 모델의 위험을 측정할 수 있습니다. 포괄적인 모델 온보딩 프로세스의 일환으로, 다양한 기초 모델 간의 위험 지표를 비교하여 조직의 특정 위험 허용 범위에 따라 조직 내 배포에 가장 적합한 파운데이션 모델을 파악하는 데 도움을 줍니다.

생성형 AI의 위험을 이해해야 하는 이유

기업이 생성형 AI 배포를 계속 확장함에 따라 프롬프트 주입, 독성 아웃풋, 탈옥 및 할루시네이션을 비롯한 기본 파운데이션 모델과 관련된 위험을 더 잘 이해하는 것이 점점 더 중요해지고 있습니다.

조직은 회사에서 사용할 생성형 AI 모델을 선택할 때 많은 선택권을 가지고 있습니다. 생성형 모델의 성능이 저조한 상황(예: 부정확하거나 유해한 안내를 제공하는 '불량' 고객 응대 챗봇)을 피하려면 정보에 입각한 결정을 내리는 것이 중요합니다. 이러한 상황은 조직이 회복하기 어려울 정도로 평판에 큰 영향을 미칠 수 있습니다. 따라서 이러한 상황을 방지하기 위해 객관적인 정량적 위험 데이터를 확보하는 것이 조직의 모델 온보딩 프로세스의 일부가 되어야 합니다.

생성형 AI 모델의 온보딩 프로세스는 다음과 같은 3단계로 구성됩니다.

  1. 생성형 AI의 일반적인 위험을 이해합니다.
  2. 특정 AI 모델(또는 사용 사례)에 적용할 수 있는 위험을 식별합니다.
  3. 식별된 위험을 평가합니다.

이해: 위험 라이브러리

위험 라이브러리를 구축하는 것은 어떤 위험이 적용될 수 있는지 이해하기 위한 첫 번째 단계입니다. IBM의 AI Risk Atlas는 생성형 AI 및 머신 러닝 모델의 사용과 관련된 위험을 이해하는 데 유용한 리소스입니다. 또한 위험은 watsonx.governance의 거버넌스 콘솔에 직접 통합되며 즉시 사용할 수 있습니다. 원하는 경우 위험 라이브러리는 조직의 자체 재고로 보완될 수도 있습니다. 즉시 사용 가능한 위험 식별 평가(AI 사용 사례, 모델 온보딩 및 사용 사례 + 모델 결합)를 사용하여 위험을 AI 사용 사례 및 모델에 연결할 수 있습니다.

Risks의 watsonx 대시보드 스크린샷

적용 가능한 위험을 이해하는 것이 첫 번째 단계이지만, 이러한 위험을 식별, 측정, 완화할 수 있는 효과적인 방법을 마련하는 것도 마찬가지로 중요합니다.

식별: 위험 식별 프로세스

watsonx.governance는 다음과 같은 3가지 위험 식별 평가를 제공합니다.

  • AI 사용 사례 위험 식별: 제안되는 사용 사례와 관련이 있으며 모델에 국한되지 않는 위험을 식별하는 데 사용됩니다. 예를 들어, 프롬프트 주입, 프롬프트의 IP 정보 및 개인 정보 노출 등이 있습니다.
  • AI 모델 온보딩 위험 식별: 평가 중인 모델에 특정한 위험을 식별하는 데 사용됩니다. 예를 들어 데이터 편향, 불확실한 데이터 출처, 교육 데이터 투명성 부족, 재식별 등이 있습니다.
  • 사용 사례 + 모델 위험 식별: 사용 사례와 모델의 특정 조합에서 발생할 수 있는 추가 위험 집합을 식별하는 데 사용됩니다. 예를 들어, 모델 사용 권한 제한, 할루시네이션, 설명할 수 없는 아웃풋 등이 있습니다.

이러한 평가는 Risk Atlas의 어떤 위험이 온보딩 중인 모델 및/또는 사용 사례에 적용되는지 결정하는 데 사용됩니다. watsonx.governance 거버넌스 콘솔에는 위에서 언급한 위험 식별 설문지 평가를 포함하는 파운데이션 모델 온보딩용 워크플로가 있습니다.

파운데이션 모델 온보딩을 위한 워크플로 다이어그램

식별된 위험은 위험 및 통제 자체 평가(RCSA)를 통해 개별적으로 검토하여 내재적 위험과 잔여 위험을 파악해야 합니다. 이를 통해 모델에 대한 위험 프로필이 생성되며, 이를 통해 조직이 RAG, 분류 또는 요약 등 모델에 대해 어떤 유형의 사용을 승인할 의향이 있는지 파악할 수 있습니다.

잔여 위험 등급 차트

RCSA 프로세스에 대한 정보를 더 잘 제공하기 위해 몇 가지 정량적 평가를 수행하여 특정 모델의 위험과 유사한 모델과의 비교에 대해 더 깊이 이해할 수 있습니다. 또한 기업은 개발하거나 개선하는 모든 모델의 위험을 평가할 수 있는 권한이 있습니다(예: 미세 조정을 통해).

평가: 모델 위험 평가 엔진 소개

현재 watsonx.governance의 일부인 Model Risk Evaluation Engine은 파운데이션 모델의 정량적 위험 평가를 지원합니다. AI Risk Atlas에서 정의된 위험 차원 집합과 관련된 지표를 계산합니다. 기업은 다양한 파운데이션 모델에 대해 이러한 지표를 계산함으로써 비즈니스 목표를 달성하는 동시에 위험 선호도에 맞는 모델을 선택할 수 있습니다.

Model Risk Evaluation Engine은 IBM watsonx.ai의 대규모 언어 모델 및 외부 대규모 언어 모델의 평가를 지원합니다. 완료된 평가 엔진 결과는 watsonx.governance의 거버넌스 콘솔에 저장하거나 PDF 보고서로 내보낼 수 있습니다.

Model Risk Evaluation Engine은 다음 작업을 수행하는 데 도움이 됩니다.

  • watsonx.ai를 추론 엔진으로 사용하여 지표 계산
  • watsonx.ai에서 파운데이션 모델에 대한 위험 지표 계산
  • 외부 파운데이션 모델에 대한 위험 지표 계산
  • 거버넌스 콘솔(OpenPages)에 계산된 지표 저장
  • 거버넌스 콘솔(OpenPages)에서 계산된 지표 검색
  • 자체 위험 및 데이터 세트 추가
  • 계산된 지표에 대한 PDF 보고서 생성
  • 평가를 수행하는 모든 모델에 대해 자체 스코어링 함수 구현(예: 결정론적 함수 또는 LLM-as-a-judge)
  • 노트북 셀의 지표를 표 또는 차트 형식으로 표시

이 모든 데이터가 거버넌스 콘솔로 다시 유입되면 위에서 설명한 기초 모델 온보딩 워크플로의 위험 평가 단계에 정보를 제공하는 데 사용할 수 있습니다.

지금 액세스 및 살펴보기

watsonx.governance 사용자는 다음 명령을 실행하여 Model Risk Evaluation Engine에 액세스할 수 있습니다.

pip install ibm_watsonx_gov[mre]

샘플 노트북에는 직접 시도해 볼 수 있는 지침이 포함되어 있습니다. Model Risk Evaluation Engine 문서 페이지에는 자세한 정보도 포함되어 있습니다.

조직에서 생성형 AI 위험을 효과적으로 식별, 측정, 완화하려면 watsonx.governance 같은 엔드 투 엔드 AI 거버넌스 솔루션이 중요합니다. 직접 사용해 보거나 지금 바로 IBM 전문가와 상담할 수 있는 시간을 예약하세요. 

지금 바로 watsonx.governance 체험하기

IBM의 AI 거버넌스 서비스에 대해 알아보기