AI 모델이 스스로를 평가해야 하는 경우가 점점 더 많아지고 있으며, 이는 '감시자를 누가 감시하는가' 하는 중요한 질문을 제기하고 있습니다.
AI 기업들은 다른 AI 시스템을 평가하기 위한 모델을 개발하여 기존의 인간 주도 평가 방법에서 벗어나고 있습니다. 예를 들어 Meta의 새 모델은 사람의 입력 없이 AI 성능을 평가할 수 있습니다. 그리고 이로 인해 자동화된 테스트의 정확성과 한계에 대한 연구자들의 논의가 촉발되고 있습니다.
자가 학습 평가기는 AI가 생성한 학습 데이터와 생각의 연결고리 기법을 사용하여 과학, 코딩 및 수학 응답을 평가합니다. 목표는 투명성이지만 여기에는 위험이 따릅니다. "검증자를 검증하는 것은 큰 문제"라고 IBM 펠로우인 Fellow Kush는 말합니다. AI 자체 평가는 효율성을 높일 수 있지만 심각한 위험도 수반합니다. Varshney와 그의 팀은 다른 AI 아웃풋을 평가할 수 있는 LLM-as-a-judge 모델, 즉 LLM에 대한 지표를 개발하고 있습니다. 그러나 Varshney는 "이는 여전히 미해결된 연구 문제"라고 말합니다.
핵심적인 관심사는 AI 모델이 스스로 개선할 수 있게 신뢰할 수 있는지, 아니면 스스로의 오류를 증폭시킬 위험이 있는지 여부입니다.
"마이크를 스피커에 가까이 가져가는 것을 생각해 보세요."라고 Varshney는 말합니다. "어떤 피드백 시스템에서든 오류나 노이즈가 증폭됩니다."
Meta의 자가 학습 평가기는 사람이 자신의 사고 과정을 설명하는 것과 유사한 방식으로 추론 흔적을 제공하여 이러한 위험을 완화하려고 시도합니다. 그러나 합성 데이터와 자체 개선에만 의존하면 다음과 같은 의문이 제기됩니다. 모델의 판단이 편향되지 않은가요? 일반적으로 편향된 데이터 또는 알고리즘의 결과로 AI 시스템의 아웃풋이 불공정하거나 편향된 가정을 반영하는 경우 편향 결과가 발생합니다.
Varshney는 "목표는 LLM 판사가 편향되지 않은 것이어야 하므로 우리는 그들의 편견을 평가해야 합니다."라고 말합니다. 한 가지 방법은 객관식 답을 섞어서 모델이 위치 편향(한 답을 다른 답보다 선호한다는 의미)을 보이는지 확인하는 것입니다. 장황한 편향 및 자기 향상 편향과 함께 직책 편향은 모두 평가를 왜곡할 수 있습니다. "이러한 위험을 관리하는 것은 AI 개발의 일부입니다."라고 Varshney는 말합니다. 책임감 있는 AI 발전을 위해서는 편향을 파악하고 완화해야 합니다.
고급 수학 및 연구와 같은 전문 분야에서는 신뢰할 수 있는 AI 자체 평가를 보장하는 것이 훨씬 더 어렵습니다. 즉, 결과를 검증하고 AI 시스템의 신뢰성을 유지하고 순조롭게 진행하려면 인간 전문가가 필요한 경우가 많습니다.
"그렇게 하려면 객관식 답변을 이리저리 섞는 것과 같은 많은 요령이 필요합니다."라고 Varshney는 말합니다.
QueryPal의 설립자이자 CEO인 Dev Nag에 따르면, Meta의 자가 학습 평가기는 인간의 판단력을 증폭하고 확장하는 것이지, 인간을 루프에서 제거하는 것이 아니라고 합니다.
"이는 교사가 무엇이 좋은 답이고 나쁜지 이해를 바탕으로 연습 문제를 만드는 것과 유사하다고 생각하면 됩니다."라고 Nag는 말합니다. "알파고가 자기 대국을 하기 전에 바둑 규칙을 기초로 삼았던 것처럼, 자가 학습 평가기는 인간의 판단을 암시적으로 포함하는 합성 훈련 예제를 생성하기 전에 인간이 확립한 품질 기준을 기반으로 구축합니다."
자체 모니터링 AI를 사용하더라도 정기적인 감사를 통해 숨겨진 편견이나 문제를 발견할 수 있다고 Arrive AI의 회장 겸 CEO인 Dan O'Toole은 말합니다.
"여러 AI 모델을 사용하여 동일한 평가를 독립적으로 수행하거나 순차적으로 연결하면 오류가 줄어들고 잠재적인 문제가 강조 표시됩니다."라고 그는 말합니다. 설명 가능성도 필수적입니다. "생각의 연결고리는 투명성을 향한 중요한 단계이며, 신뢰성을 높입니다."
O'Toole은 고급 수학 및 과학 연구와 같은 분야에서는 전문 지표가 매우 중요하다고 강조합니다. 예를 들어 Meta는 범용 평가를 위해 MT-Bench와 RewardBench를 사용했지만 수학적 문제 해결에는 벤치마크가 적합하다고 그는 말합니다. CruxEval은 코드 추론을 지원할 수 있으며, FactKB, PubMed 및 SciBench와 같은 도메인별 벤치마크는 모델이 특정 요구 사항을 충족하는지 확인하는 데 도움이 될 수 있습니다.
Nag은 특히 전문 분야에서 성능을 측정하고 신뢰성을 보장하는 것이 중요하다고 강조합니다. 그는 결과가 해당 분야의 인간 전문가가 내린 평가와 얼마나 잘 일치하는지가 궁극적인 벤치마크라고 믿습니다.
"자가 학습 평가기가 RewardBench에서 인간 판단에 88.7%를 동의하는 것은 강력한 기준이 되지만, 일관성, 설명 가능성, 엣지 사례를 식별하는 시스템의 능력과 같은 다른 요소를 추적하는 것도 똑같이 중요합니다."라고 그는 말합니다. "알파고의 자기 대국이 인간 챔피언과의 대결에서 성능을 검증받은 것처럼, 평가자 시스템도 도메인 전문가 패널을 대상으로 정기적으로 테스트를 거쳐야 합니다."
EisnerAmper에서 자문 및 기술 서비스를 이끌고 있는 Jen Clark은 AI 개발에는 안전과 효과적인 발전을 보장하기 위한 구조화된 프레임워크가 필요하다고 강조합니다.
"AI가 계속 발전함에 따라 과학적 방법, 강력한 커뮤니티, 협업 네트워크 등 인간 연구를 지원해 온 방법론에 의존하는 것이 중요해졌습니다."라고 그녀는 말합니다. "AI 안전을 크라우드소싱하고 AI 개발의 속도와 규모를 관리하려면 여기에 노력을 집중하는 것이 필수적입니다."