AI 관측 가능성이란 무엇인가요?

게시일 2025년 12월 30일
수정일 2026년 06월 22일
감시실에서 CCTV를 모니터링하며 대화를 나누는 여성 보안 요원들.
By Derek Robertson and Matthew Kosinski

AI 관측 가능성 정의

인공 지능(AI) 관측 가능성토큰 사용량, 응답 품질, 모델 드리프트 등 고유한 원격 측정 데이터를 모니터링하여 AI 모델과 기타 AI 기반 툴 및 시스템을 이해할 수 있는 능력입니다.

기존의 관측 가능성 툴은 관측 가능성의 세 가지 핵심 요소인 로그, 트레이스, 지표를 사용하여 복잡한 시스템의 내부 상태 또는 조건을 이해합니다. AI 애플리케이션과 AI 에이전트는 고유한 관측 가능성 툴을 필요로 하는 추가적인 복잡성 계층을 도입하며, 이를 통해 AI 관련 아웃풋을 모니터링하고 (종종 AI가 생성한) 시각화를 생성하여 모델 성능을 최적화할 수 있습니다.

기존 소프트웨어와 달리, 대규모 언어 모델(LLM)과 기타 생성형 인공 지능 애플리케이션의 아웃풋은 확률적입니다. 동일한 입력이 서로 다른 응답을 낼 수 있어, 입력이 아웃풋에 어떤 영향을 미치는지 추적하기 어려우므로 기존 관측 가능성 툴에 문제가 발생할 수 있습니다. 결과적으로, 문제 해결, 디버깅 및 성능 모니터링은 생성형 AI 시스템에서 더 복잡합니다.

또한 많은 AI 모델의 '블랙 박스'라는 특성을 줄이기 위해 성장하고 있는 분야인 AI의 설명 가능성은 모델이 광범위한 IT 시스템 및 워크플로와 상호 작용하는 방식을 아직 완벽하게 설명할 수 없습니다. AI 관측 가능성 솔루션은 효과적으로 측정하고 분석할 수 있는 항목에 우선순위를 두어야 합니다. 이러한 우선순위 지정은 모델을 비공개로 실행하고 관리하는 OpenAI 또는 Google과 같은 타사의 모델을 사용할 때 특히 중요합니다.

AI 에이전트는 IT 에코시스템 전반에 걸쳐 워크플로를 자율적으로 설계하고 실행하는 시스템으로, 관측 가능성에 고유한 도전 과제를 제기하며 그에 맞는 독특한 데이터 수집 접근법을 요구합니다. 2025년 IBM 기업가치연구소(IBV) 설문 조사에서 경영진의 거의 절반은 에이전트 AI의 '주요 구현 장벽으로 에이전트 의사 결정에 대한 가시성 부족'을 꼽았습니다. 이러한 시스템의 관측 가능성은 도입에 있어 매우 중요합니다.

AI 관측 가능성 작동 방식

AI 관측 가능성은 기술 스택 전반에서 AI 관련 지표를 실시간으로 수집하여 대시보드로 구성하는 방식으로 작동합니다. AI 관측 가능성은 관리자에게 AI 모델의 내부 작동에 대한 더 뛰어난 인사이트를 제공하는 동시에, 병목 현상, 할루시네이션, 지연 시간 등을 줄이는 데 도움이 됩니다.

관측 가능성의 전통적인 핵심 요소

관측 가능성 플랫폼은 AI 시스템에 특화된 다양한 유형이 있는 세 가지 주요 유형의 원격 측정 데이터, 즉 로그, 추적, 지표에 중점을 둡니다.

로그

로그는 세분화되고 타임스탬프가 찍히며 완전하고 변경할 수 없는 애플리케이션 이벤트 기록입니다. 무엇보다도 로그를 사용하여 주변 컨텍스트를 포함한 IT 시스템의 모든 이벤트에 대한 정확도가 높은 밀리초 단위 기록을 만들 수 있습니다. 개발자는 AI 개발에서 문제 해결 및 디버깅을 위해 로그를 사용합니다.

추적

추적은 사용자 인터페이스 또는 모바일 앱에서 전체 아키텍처 및 AI 모델을 거쳐 사용자에게 돌아오는 모든 사용자 요청의 엔드투엔드 '여정'을 기록합니다.

지표

지표는 시간 경과에 따른 애플리케이션 및 시스템 상황의 기본 측정값입니다. 예를 들어, 지표는 애플리케이션이 5분 동안 사용하는 메모리 또는 CPU 용량이나 사용량이 급증하는 동안 애플리케이션이 경험하는 지연 시간을 측정하는 데 사용됩니다.

AI 관련 관측 가능성 데이터

AI 에이전트, 생성형 AI 및 기타 AI 시스템도 관리자에게 실행 가능한 인사이트를 제공하기 위해 수집 및 분석해야 하는 고유한 유형의 원격 측정 데이터를 생성합니다.

토큰 사용량, 모델 드리프트, 응답 품질은 대부분의 AI 관측 가능성 이니셔티브의 세 가지 핵심 데이터 포인트입니다. 이러한 요인을 모니터링하면 모델 라이프사이클 전반의 성능 문제를 줄이고 사용자 경험을 개선하는 데 도움이 될 수 있습니다.

GPU 사용량, 네트워크 인프라의 병목 현상, 사용자 인터페이스 피드백과 같은 보다 전통적인 원격 측정 데이터도 모델과 관련된 경우 AI 관측 가능성 툴을 통해 수집할 수 있습니다.

토큰 사용량

토큰은 AI 모델이 이해할 수 있는 개별 언어 단위(일반적으로 단어 또는 단어의 일부)입니다. 모델이 입력값을 이해하거나 아웃풋을 생성하기 위해 처리하는 토큰의 수는 LLM 기반 애플리케이션의 비용과 성능에 직접적인 영향을 미칩니다. 토큰 소비량이 많을수록 운영 비용과 응답 지연 시간이 늘어날 수 있습니다.

토큰 사용량을 추적하기 위한 주요 지표는 다음과 같습니다.

  • 토큰 소비율 및 비용 - 운영 비용을 정량화하는 데 도움이 됩니다.

  • 토큰 효율성 - 상호작용에서 각 토큰의 효과성을 측정하는 지표입니다. 효율적인 상호작용은 고품질의 아웃풋을 확보하고 소비되는 토큰 수를 최소화할 수 있습니다.

  • 다양한 프롬프트 유형에 따른 토큰 사용 패턴 - 모델의 리소스 집약적 사용을 식별할 수 있습니다.

이러한 지표는 조직이 토큰 소비를 줄이기 위한 최적화 기회를 식별하는 데 도움이 될 수 있습니다. 예를 들어 프롬프트를 개선하여 더 적은 수의 토큰으로 더 많은 정보를 전달할 수 있습니다. 토큰 활용을 최적화함으로써 조직은 머신 러닝 워크로드에 대한 추론 비용을 잠재적으로 줄이면서 높은 응답 품질을 유지할 수 있습니다.

모델 드리프트

기존 소프트웨어와 달리 AI 모델은 실제 데이터가 진화함에 따라 동작을 바람직하지 않은 방식으로 점진적으로 변경할 위험이 있습니다. 이러한 현상은 모델 드리프트로 알려져 있으며 AI 시스템의 안정성과 성능을 크게 저하시킬 수 있습니다.

모델 드리프트를 추적하기 위한 주요 지표는 다음과 같습니다.

  • 시간 경과에 따른 응답 패턴의 변화 - 새로운 불일치를 식별합니다.

  • 아웃풋 품질이나 관련성의 변화 - 모델 성능 저하를 의미할 수 있습니다.

  • 지연 시간 또는 리소스 사용률의 변화 - 비효율적인 계산을 의미할 수 있습니다.

드리프트 감지 메커니즘은 특정 사용 사례에서 모델의 정확도가 감소할 때 조기 경고를 제공할 수 있으므로, 모델이 비즈니스 운영을 방해하기 전에 팀이 개입할 수 있습니다.

응답 품질

AI 아웃풋 품질 모니터링은 신뢰, 안정성, 규정 준수 유지에 필수적입니다. 응답 품질을 추적하기 위한 주요 지표는 다음과 같습니다.

  • 다양한 유형의 프롬프트에서 할루시네이션의 빈도 - 부정확한 아웃풋에 대한 가능한 트리거를 식별합니다.

  • 생성된 응답의 사실적 정확성 - 종종 외부 검증과 인간의 감독이 필요함

  • 유사한 입력에 대한 아웃풋의 일관성 유지 - 시간 경과에 따른 모델의 안정성을 인증합니다.

  • 사용자 프롬프트에 대한 응답의 관련성 - 모델이 사용자 의도에 어떻게 부합하는지 평가합니다.

  • 지연 시간 추적 - 속도와 정확성을 위해 절충이 필요한 사용자 대면 AI 애플리케이션에 매우 중요합니다. 다양한 유형의 프롬프트에 대한 응답 시간을 모니터링하면 조직에서 성능 병목 현상과 컴퓨팅 비효율성을 정확히 파악하는 데 도움이 될 수 있습니다.
IBM DevOps

DevOps란 무엇인가요?

Andrea Crawford는 DevOps의 정의, DevOps의 가치, 그리고 DevOps 사례와 툴이 아이디어 구상부터 프로덕션에 이르기까지 전체 소프트웨어 Delivery Pipeline을 통해 앱을 이동하는 데 어떻게 도움이 되는지 설명합니다. 최고의 IBM 사고 리더가 이끄는 이 커리큘럼은 비즈니스 리더가 성장을 주도할 수 있는 AI 투자의 우선순위를 정하는 데 필요한 지식을 얻을 수 있도록 설계되었습니다.

OpenTelemetry 및 AI 관측 가능성

원격 측정 데이터를 수집하고 전송하기 위한 오픈 소스프레임워크인 OpenTelemetry(OTel) 는 AI가 제기하는 관측 가능성 문제를 개선하는 데 도움이 될 수 있습니다.

AI 제공업체의 경우 OpenTelemetry는 독점 모델 세부 정보나 소스 코드를 노출하지 않고도 성능 데이터 공유 방법을 표준화할 수 있는 수단을 제공합니다. 기업의 경우 여러 모델, 다양한 종속성 및 검색 증강 생성(RAG) 시스템을 포함할 수 있는 복잡한 AI 파이프라인에서 관측 가능성 데이터가 일관되게 흐르도록 보장합니다.

AI 관측 가능성을 위한 OpenTelemetry의 주요 이점은 다음과 같습니다.

  • 공급업체 독립성: 조직은 특정 관측 가능성 플랫폼에 종속되지 않고 AI 기술의 발전에 따라 유연성을 유지할 수 있습니다.

  • 엔드투엔드 가시성: 원격 측정 데이터는 AI 애플리케이션 인프라의 모든 구성 요소에서 일관되게 흐릅니다.

  • 미래 대비: AI 기술이 발전함에 따라 OpenTelemetry 표준이 AI 기술과 함께 조정되여 관측 가능성 전략의 관련성을 유지할 수 있습니다.

  • 에코시스템 통합: 개방형 표준을 통해 여러 공급업체의 AI 솔루션과 하이브리드 배포 모델 전반에서 관측 가능성이 가능합니다.

  • 메타데이터 표준화: OpenTelemetry는 벤더 중립적이기 때문에, 개발자가 사용하는 관측 가능성 백엔드나 벤더에 관계없이 필수적인 AI 관련 메타데이터를 캡처하고 스택 전반에 걸쳐 가시성을 유지할 수 있습니다.

관측 가능성 및 AI 에이전트

AI 에이전트는 네트워크 내에서 높은 수준의 자율성과 자동화를 갖기 때문에 관측 가능성 플랫폼의 특별한 주의가 필요하며, 특히 시스템 내에서 수행하는 작업과 해당 작업에 수반되는 로그 및 추적과 관련하여 특히 주의가 필요합니다.

LLM 사용, 이전 대화 기억, 외부 도구 사용 등 AI 에이전트를 가치 있게 만드는 바로 그 기능으로 인해 모니터링, 이해, 제어가 어려울 수 있습니다.

AI 에이전트가 수행할 수 있는 일반적인 작업에는 검색 엔진과 상호 작용하기 위해 애플리케이션 프로그래밍 인터페이스(API)를 호출하거나, 텍스트를 생성하거나 사용자 입력을 이해하기 위해 LLM을 호출하거나, 인간 직원에게 요청을 에스컬레이션하거나, 보안 침해 또는 낮은 컴퓨팅 가용성에 대한 자동 경고를 전달하는 것 등이 있습니다.

이러한 기능을 통해 AI 에이전트가 독립적으로 작동할 수 있지만, 명시적이고 사전 정의된 규칙과 논리를 기반으로 구축된 전통적인 애플리케이션에 비해 투명성이 훨씬 떨어진다는 단점도 있습니다. 관리자는 이러한 에이전트 프로세스와 관련된 데이터를 추적하여 에이전트의 동작에 대한 인사이트를 얻고 규정 준수 위반, 운영 장애, 그에 따른 사용자 신뢰 약화를 방지할 수 있습니다.

AI 에이전트 관측 가능성의 고유한 로그는 다음과 같습니다.

  • 사용자 상호작용 로그 - 사용자와 AI 에이전트 간의 모든 상호작용을 기록

  • LLM 상호 작용 로그 - 에이전트와 LLM 간의 상호 작용을 문서화하는 상호작용입니다.

  • 도구 실행 로그 - 툴과 계측 에이전트가 사용하는 도구, 사용 시기, 전송하는 명령과 반환하는 결과 등을 측정합니다.

  • 에이전트 의사결정 로그 - 가능한 경우, AI 에이전트가 특정 결정이나 행동에 도달한 과정을 기록

AI 관측 가능성의 이점

AI 관측 가능성의 이점에는 모델 사용 비용 제어, 규정 준수 용이성, 모델 자체 개선 등이 포함됩니다.

비용 관리

AI 기반 툴이 IT 에코시스템과 상호 작용하는 방식에 대한 더 깊은 인사이트를 얻으면 낭비되는 리소스를 식별할 수 있습니다. 예를 들어, 조직이 모델이 할당된 처리 능력의 일부만 사용한다고 판단하면, DevOps 팀은 리소스를 축소하거나 더 필요한 곳으로 전환할 수 있습니다.

AI 규정 준수

AI 관측 가능성 툴은 규정 준수 감사를 위해 AI 에이전트 원격 측정 데이터를 자동으로 수집, 처리, 저장할 수 있습니다. 유럽 연합의 AI 법과 미국의 여러 주정부 규제안을 비롯한 법률이 AI의 비즈니스 사용을 표준화하고 모델에 사용되는 개인 식별 정보(PII)를 보호하기 위한 노력을 촉발함에 따라 감사 지원의 중요성이 점점 더 커지고 있습니다.

모델 무결성 유지

모델 개발자에게 있어 관측 가능성 툴이 수집하는 원격 측정 데이터의 양은 모델 드리프트를 줄이고, 어떤 기능이 가장 가치 있고 유용한지(또는 가장 제대로 작동하지 않는지)를 추적하고, 편향성과 공정성을 확인하는 데 도움이 될 수 있습니다.

AI 관측 가능성과 머신 러닝(ML) 관측 가능성의 비교

AI 관측 가능성은 원격 측정 데이터를 통해 AI 시스템을 이해하는 방법인 반면, 머신 러닝 관측 가능성은 보다 구체적으로 AI 도구가 모델 수준에서 데이터를 사용하는 방식에 중점을 둡니다.

모델이 수집하고 학습하는 데이터는 끊임없이 변화하기 때문에 머신 러닝 원격 측정에 대한 이해는 매우 중요합니다. 모델이 내부적으로 어떻게 작동하는지 깊이 파악하면 관리자는 모델이 표류하거나 효율성이 저하된 이유뿐만 아니라 그 이유도 알 수 있습니다.

머신 러닝 관측 가능성, 그리고 주로 LLM 관측 가능성에 대한 주요 지표는 모델 품질, 모델이 수집하는 데이터 자체, 모델이 주변 인프라와 상호 작용하는 방식을 측정합니다.

모델 품질

모델 유형에 따라 관측 가능성 플랫폼이 추적할 수 있는 품질 지표도 달라집니다.

데이터를 미리 정의된 클래스로 분류하는 분류 모델의 경우, 일반적인 성능 지표는 다음과 같습니다.

  • 정확도: 총 예측수 대비 올바른 예측 수

  • 정밀도 및 재현율: 선택한 항목이 얼마나 관련성이 있는지를 측정하는 척도입

  • F1 점수: 일반적으로 사용되는 이러한 지표들의 조합

반면 회귀 모델은 모델에서 수행한 예측과 해당 데이터 포인트 간의 평균 차이를 측정하는 평균 제곱근 오차와 같은 지표로 평가되는 경우가 많습니다.

핵심 데이터

머신 러닝 관측 가능성은 입력 데이터와 학습 데이터 간의 큰 차이 또는 예측의 통계적 분포 변화와 같은 데이터 드리프트뿐만 아니라 누락된 값, 오류 및 유효하지 않은 값 유형과 같은 단순한 데이터 품질 지표도 측정할 수 있습니다. 머신 러닝 관측 가능성 툴은 이러한 지표를 사용하여 근본 원인 분석을 수행하여 모델 드리프트를 이해하거나 발생하기 전에 이를 방지할 수 있습니다.

운영

머신 러닝 관측 가능성은 지연 시간, 메모리 사용량, 처리량 또는 주어진 시간 동안 모델이 수행할 수 있는 예측 횟수 등 모델과 관련이 있을 수 있는 보다 전통적인 지표도 측정하는 경우가 많습니다.

작성자

Derek Robertson

Staff Writer

IBM Think

Matthew Kosinski

Staff Editor

IBM Think

관련 솔루션
IBM Instana Observability

AI와 자동화를 활용하여 애플리케이션 스택 전반의 문제를 선제적으로 해결하세요.

IBM Instana Observability 살펴보기
IBM 관측 가능성 솔루션

AI 기반 관측 가능성을 통해 운영 복원력을 극대화하고 클라우드 네이티브 애플리케이션의 상황을 안정적으로 유지하세요.

IBM 관측 가능성 솔루션 살펴보기
IBM Consulting AIOps

생성형 AI로 IT 자동화 및 운영을 강화하여 IT 인프라의 모든 영역을 비즈니스 우선순위에 맞게 조정하세요.

IBM Consulting AIOps 살펴보기
다음 단계 안내

IBM Instana가 SaaS 또는 자체 호스팅으로 실시간 애플리케이션 성능 모니터링 및 AI 기반 인사이트를 제공하는 방법을 알아보세요.

  1. IBM Instana Observability 살펴보기
  2. 실제 사용 사례 보기