LLM 모니터링

Instana UI에서 LLM 메트릭 및 추적을 모니터링할 수 있습니다.

LLM 메트릭

LLM 지표를 보려면 GenAI 관찰 가능성 > LLM 지표를 클릭하세요.

LL M 메트릭스 탭에는 비용, 지연 시간 및 기타 성능 세부 정보가 표시됩니다.

매개변수 설명
입력 비용 LLM에 입력 토큰, 즉 프롬프트 또는 쿼리를 전송하는 데 발생하는 비용.
출력 비용 입력에 대한 응답으로 대규모 언어 모델(LLM)이 생성한 토큰에 소요되는 비용.
총 비용 입력에 대한 응답으로 LLM이 생성한 토큰의 총 비용. 비용은 투입 비용과 산출 비용의 합계이다.
모델 관찰 기간 동안 사용된 LLM 모델의 수. 이 수치는 사용된 언어 모델의 다양성을 나타냅니다.
GenAI 서비스 사용된 생성형 AI 서비스 제공업체 또는 엔드포인트의 수. 각 모델은 서로 다른 서비스에서 호스팅될 수 있으며, 이는 성능과 가격 측면에서 잠재적인 차이를 반영합니다.
LLM 호출 (총계) LLM이 호출된 횟수, 즉 프롬프트-응답 상호작용이 발생한 횟수. 이 지표는 모델들의 전반적인 활동 수준을 보여줍니다.
토큰 사용법 시간에 따른 토큰 사용량. LLM 모델 또는 서비스별로 사용량을 필터링하여 개별 또는 집단의 소비 패턴을 파악할 수 있습니다.
비용 LLM 모델의 시간에 따른 비용 추이. LLM 모델이나 서비스별로 사용량을 필터링하여 비용 효율성을 분석할 수 있습니다.
LLM 호출 시간에 따른 LLM 호출 횟수. LLM 모델 또는 서비스별 모델 호출 빈도를 확인하여 사용량이 가장 많은 시기를 파악할 수 있습니다.
LLM 대기 시간 시간에 따른 대규모 언어 모델 호출의 지연 시간. 이 지표는 각 모델의 응답 시간을 측정하여, 모델이 결과를 얼마나 빠르게 생성하는지 보여줍니다.
모델 이름 사용된 LLM 모델.
입력 토큰 LLM에 전송되는 프롬프트 또는 쿼리 내 토큰의 수.
출력 토큰 LLM이 응답으로 생성한 토큰의 수.
총 토큰 수 각 상호작용에 대한 전체 토큰 수를 나타내는 입력 토큰과 출력 토큰의 합계.
총 비용 LLM이 생성한 토큰에 대한 총 지출액.
대기 시간(평균) 모든 호출에 걸친 LLM의 평균 응답 시간.
호출 수 LLM이 호출되거나 실행된 총 횟수.

LLM 추적

LLM 트레이스를 보려면 ‘Gen AI 가시성 > 트레이스’를 클릭하세요.

입력 프롬프트와 출력 응답을 포함한 LLM 트레이스가 ‘트레이스’ 탭에 표시됩니다.

매개변수 설명
추적 ID 생성형 AI 시스템과의 각 추적 기록 또는 상호작용에 할당되는 고유 식별자. 특정 요청을 추적하고 디버깅하는 데 유용합니다.
Gen AI 서비스 프롬프트를 처리하는 데 사용된 생성형 AI 서비스.
입력 프롬프트 AI 모델에 제출되는 질문 또는 명령어.
출력 응답 입력 프롬프트에 대한 응답으로 AI 모델이 생성한 답변.
총 토큰 수 상호작용에 사용된 토큰의 총 개수(입력 및 출력 모두 포함).
지속 기간 AI 모델이 응답을 생성하는 데 소요되는 시간으로, 밀리초 단위로 측정됩니다. 이 값은 성능과 지연 시간을 평가하는 데 도움이 됩니다.
상태 상호작용이 성공했는지 여부를 나타냅니다. 녹색 체크 표시가 응답이 오류 없이 성공적으로 생성되었음을 나타냅니다.

추적 세부 정보의 LLM 작업 보기

LLM 호출이 포함된 트레이스를 볼 때, LLM 작업 보기를 통해 LLM 상호 작용에 대한 상세 정보를 확인할 수 있습니다. 이 보기는 애플리케이션 추적 내의 생성형 AI 운영에 대한 포괄적인 통찰력을 제공합니다.

LLM 작업 보기 열기

LLM 작업 보기를 열려면:

  1. GenAI 관찰 가능성 > 추적 으로 이동합니다.
  2. LLM 호출이 포함된 트레이스를 클릭하세요.
  3. 추적 세부 정보 보기에서 LLM 호출 스팬을 찾아 클릭합니다. LLM 작업 보기에는 선택한 LLM 상호작용에 대한 상세 정보가 표시됩니다.
    참고:
    새로 수집된 트레이스가 ‘트레이스’ 페이지에 표시되지만, LLM 작업 보기에 데이터가 생성되어 반영되기까지는 최대 1분 정도 걸릴 수 있습니다.

LLM 작업 보기 정보

LLM 작업 보기에서는 다음과 같은 정보를 제공합니다:

표 1. LLM 작업 보기 매개변수
매개변수 설명
모델 이름 예를 들어, 상호작용에 사용된 구체적인 gpt-4 LLM 모델은 또는 claude-3-opus등입니다.
입력 프롬프트 LLM에 전송된 전체 프롬프트 또는 쿼리(시스템 메시지나 컨텍스트 포함).
출력 응답 LLM이 생성한 전체 응답.
입력 토큰 입력 프롬프트에 포함된 토큰의 수.
출력 토큰 생성된 응답에 포함된 토큰의 수.
총 토큰 수 입력 토큰과 출력 토큰의 합계.
입력 비용 입력 토큰을 처리하는 데 소요된 비용.
출력 비용 출력 토큰을 생성하는 데 소요된 비용.
총 비용 입력 비용과 출력 비용의 합계인 LLM 상호작용의 총 비용.
지속 기간 LLM이 요청을 처리하고 응답을 생성하는 데 걸리는 시간.
온도 LLM 호출에 사용되는 샘플링 온도로, 출력의 무작위성을 조절합니다.
최대 토큰 응답에 허용되는 토큰의 최대 개수.
상위 P 출력 다변성을 제어하는 데 사용되는 코어 샘플링 매개변수.
빈도 페널티 출력에서 토큰의 중복을 줄이기 위해 적용된 페널티입니다.
존재 페널티 이 페널티는 모델이 새로운 주제에 대해 이야기하도록 유도하기 위해 적용되었습니다.
그림 1. Instana 의 LLM 작업 보기
LLM 작업 보기

LLM 작업 보기의 장점

LLM 작업 보기는 다음과 같은 기능을 제공합니다:

  • 문제나 예상치 못한 동작을 파악하기 위해 정확한 프롬프트와 응답을 검토하여 LLM 상호작용을 디버깅하십시오.
  • 개별 LLM 호출에 대한 토큰 사용량과 비용을 분석하여 비용 절감 기회를 파악함으로써 비용을 최적화합니다.
  • 애플리케이션 추적 내의 LLM 작업에 대한 지연 시간과 응답 시간을 추적하여 성능을 모니터링하십시오.
  • 각 LLM 호출에 사용된 매개변수를 검토하여 모델의 동작을 파악하고, 이러한 매개변수가 출력에 어떤 영향을 미치는지 이해하십시오.
  • 상류 및 하류 호출을 포함한 전체 애플리케이션 추적 정보의 맥락에서 LLM 상호작용을 확인하세요.

LLM 진행 상황 보기

‘궤적(Trajectory) ’ 보기를 사용하여 에이전트 또는 LLM 호출의 모든 단계를 확인해 보세요. 에이전트 또는 LLM 호출이 포함된 트레이스를 열면, ‘Trajectory’ 보기를 통해 모든 프롬프트, 도구 호출 및 모델 응답이 포함된 전체 실행 트레이스를 확인할 수 있습니다.

이 화면에서는 각 에이전트 작업을 번호가 매겨진 작업 항목으로 표시합니다. 검색 가능한 목록을 사용하여 원하는 작업으로 이동할 수 있으며, 작업 상세 패널을 통해 해당 작업의 전체 내용을 확인할 수 있습니다.

LLM 궤적 보기 열기

‘궤적’ 보기를 열려면 다음 단계를 따르십시오:

  1. Instana UI의 탐색 메뉴에서 GenAI 관찰 가능성 > 추적을 선택합니다.
  2. LLM 호출이 포함된 트레이스를 클릭하세요.
  3. 헤더 내비게이션에서 ‘궤적’ 탭을 클릭합니다. 보기가 ‘작업 계층 구조’ 보기에서 ‘경로’ 보기로 전환됩니다.

방금 입력한 트레이스가 표시됩니다. 다만, ‘궤적(Trajectory) ’ 보기의 경우 해당 데이터를 생성하고 표시하는 데 최대 1분이 소요될 수 있습니다. {: note}

LLM 경로 보기 정보

LLM 경로 보기에서는 다음과 같은 정보를 제공합니다:

표 2. LLM 경로 보기 매개변수
매개변수 설명
태스크 이름 주석 추가 단계가 포함된 에이전트 작업의 이름.
하위 작업명 주석 단계 내 개별 LLM 하위 호출의 이름.
시작 시간 LLM 하위 공모가 시작된 날짜와 시간.
종료 시간 LLM 하위 공모가 종료된 날짜와 시간.
지속 기간 LLM 하위 호출의 총 실행 시간(밀리초 단위).
입력 토큰 이 LLM 하위 호출에 대해 모델이 수신하는 입력 프롬프트 내 토큰의 수입니다.
출력 토큰 이 LLM 하위 호출에 대해 모델이 생성한 응답에 포함된 토큰 수입니다.
총 토큰 수 LLM 하위 호출에 대한 입력 및 출력 토큰의 합계.
사용자 메시지 사용자가 LLM에 보내는 프롬프트 또는 쿼리. 이 뷰는 콘텐츠 유형에 따라 해당 콘텐츠를 일반 텍스트, JSON 또는 서식이 지정된 마크다운 형식으로 표시합니다.
어시스턴트 응답 이 LLM 하위 호출에 대해 모델이 생성한 전체 응답입니다.
도구 호출 이름 대화 턴 중에 어시스턴트가 호출하는 도구의 이름.
도구 호출 인수 어시스턴트가 도구로 전달하는 인수가 서식이 적용된 JSON 스니펫 형태로 표시됩니다.
도구 응답 어시스턴트의 도구 호출 후 해당 도구가 반환하는 결과.
입력 LLM 하위 호출의 전체 입력 페이로드. 이 페이로드는 ‘서식 지정 모드’(키-값 목록) 또는 ‘ JSON 모드’(원시 JSON )로 볼 수 있습니다.
출력 LLM 하위 호출의 전체 출력 페이로드입니다. 이 페이로드는 ‘서식 지정 모드’(키-값 목록) 또는 ‘ JSON 모드’(원시 JSON )로 볼 수 있습니다.
LLM 호출 이 작업이 수행하는 LLM 호출 횟수.
도구 호출 작업이 호출하는 툴 호출 횟수.
서브태스크 해당 작업 내의 하위 작업 수.
그림 2. Instana 의 LLM 경로 보기
Instana 의 LLM 경로 보기

LLM 경로 보기의 장점

LLM 경로 보기를 통해 에이전트 실행의 모든 단계를 상세하게 파악할 수 있습니다. 이 보기를 사용하여 다음을 수행할 수 있습니다.

  • 에이전트 실행 디버깅 : 프롬프트, 도구 호출 및 모델 응답의 정확한 순서를 따라가며, 에이전트가 예상된 동작에서 벗어난 지점이나 잘못된 결과를 산출한 지점을 파악합니다.
  • 도구 상호작용 검사 : 각 도구에 전달된 인자와 각 도구가 반환한 응답을 검토하여, 에이전트 실행 과정에서 발생한 도구 오류나 잘못 사용된 매개변수를 파악할 수 있습니다.
  • 단계별 토큰 사용량 모니터링 : 각 LLM 하위 호출 시 입력 및 출력 토큰 수를 추적하여, 에이전트의 실행 경로에서 토큰 사용량이 가장 많은 단계를 파악합니다.
  • 작업 소요 시간 분석 : 각 작업 및 LLM 하위 호출의 시작 시간, 종료 시간, 소요 시간을 검토하여 에이전트 진행 경로 전반에 걸친 지연 병목 현상을 파악합니다.
  • 에이전트의 추론 과정 파악: 사용자 메시지, 어시스턴트의 응답, 도구 결과 등 전체 메시지 시퀀스를 검토하여 모델이 작업의 각 단계에서 어떻게 추론했는지 파악합니다.
  • 에이전트 컨텍스트 추적 : 전체 작업 계층 구조 내에서 각 어노테이션 단계를 확인하고, 상위 작업의 입력, 출력, 그리고 뷰에서 집계하는 메트릭(예: LLM 호출 횟수, 도구 호출 횟수, 총 토큰 수 등)을 살펴봅니다.