LLM 모니터링
Instana UI에서 LLM 메트릭 및 추적을 모니터링할 수 있습니다.
LLM 메트릭
LLM 지표를 보려면 클릭하세요.
LL M 메트릭스 탭에는 비용, 지연 시간 및 기타 성능 세부 정보가 표시됩니다.
| 매개변수 | 설명 |
|---|---|
| 입력 비용 | LLM에 입력 토큰, 즉 프롬프트 또는 쿼리를 전송하는 데 발생하는 비용. |
| 출력 비용 | 입력에 대한 응답으로 대규모 언어 모델(LLM)이 생성한 토큰에 소요되는 비용. |
| 총 비용 | 입력에 대한 응답으로 LLM이 생성한 토큰의 총 비용. 비용은 투입 비용과 산출 비용의 합계이다. |
| 모델 | 관찰 기간 동안 사용된 LLM 모델의 수. 이 수치는 사용된 언어 모델의 다양성을 나타냅니다. |
| GenAI 서비스 | 사용된 생성형 AI 서비스 제공업체 또는 엔드포인트의 수. 각 모델은 서로 다른 서비스에서 호스팅될 수 있으며, 이는 성능과 가격 측면에서 잠재적인 차이를 반영합니다. |
| LLM 호출 (총계) | LLM이 호출된 횟수, 즉 프롬프트-응답 상호작용이 발생한 횟수. 이 지표는 모델들의 전반적인 활동 수준을 보여줍니다. |
| 토큰 사용법 | 시간에 따른 토큰 사용량. LLM 모델 또는 서비스별로 사용량을 필터링하여 개별 또는 집단의 소비 패턴을 파악할 수 있습니다. |
| 비용 | LLM 모델의 시간에 따른 비용 추이. LLM 모델이나 서비스별로 사용량을 필터링하여 비용 효율성을 분석할 수 있습니다. |
| LLM 호출 | 시간에 따른 LLM 호출 횟수. LLM 모델 또는 서비스별 모델 호출 빈도를 확인하여 사용량이 가장 많은 시기를 파악할 수 있습니다. |
| LLM 대기 시간 | 시간에 따른 대규모 언어 모델 호출의 지연 시간. 이 지표는 각 모델의 응답 시간을 측정하여, 모델이 결과를 얼마나 빠르게 생성하는지 보여줍니다. |
| 모델 이름 | 사용된 LLM 모델. |
| 입력 토큰 | LLM에 전송되는 프롬프트 또는 쿼리 내 토큰의 수. |
| 출력 토큰 | LLM이 응답으로 생성한 토큰의 수. |
| 총 토큰 수 | 각 상호작용에 대한 전체 토큰 수를 나타내는 입력 토큰과 출력 토큰의 합계. |
| 총 비용 | LLM이 생성한 토큰에 대한 총 지출액. |
| 대기 시간(평균) | 모든 호출에 걸친 LLM의 평균 응답 시간. |
| 호출 수 | LLM이 호출되거나 실행된 총 횟수. |
LLM 추적
LLM 트레이스를 보려면 클릭하세요.
입력 프롬프트와 출력 응답을 포함한 LLM 트레이스가 ‘트레이스’ 탭에 표시됩니다.
| 매개변수 | 설명 |
|---|---|
| 추적 ID | 생성형 AI 시스템과의 각 추적 기록 또는 상호작용에 할당되는 고유 식별자. 특정 요청을 추적하고 디버깅하는 데 유용합니다. |
| Gen AI 서비스 | 프롬프트를 처리하는 데 사용된 생성형 AI 서비스. |
| 입력 프롬프트 | AI 모델에 제출되는 질문 또는 명령어. |
| 출력 응답 | 입력 프롬프트에 대한 응답으로 AI 모델이 생성한 답변. |
| 총 토큰 수 | 상호작용에 사용된 토큰의 총 개수(입력 및 출력 모두 포함). |
| 지속 기간 | AI 모델이 응답을 생성하는 데 소요되는 시간으로, 밀리초 단위로 측정됩니다. 이 값은 성능과 지연 시간을 평가하는 데 도움이 됩니다. |
| 상태 | 상호작용이 성공했는지 여부를 나타냅니다. 녹색 체크 표시가 응답이 오류 없이 성공적으로 생성되었음을 나타냅니다. |
추적 세부 정보의 LLM 작업 보기
LLM 호출이 포함된 트레이스를 볼 때, LLM 작업 보기를 통해 LLM 상호 작용에 대한 상세 정보를 확인할 수 있습니다. 이 보기는 애플리케이션 추적 내의 생성형 AI 운영에 대한 포괄적인 통찰력을 제공합니다.
LLM 작업 보기 열기
LLM 작업 보기를 열려면:
- 으로 이동합니다.
- LLM 호출이 포함된 트레이스를 클릭하세요.
- 추적 세부 정보 보기에서 LLM 호출 스팬을 찾아 클릭합니다. LLM 작업 보기에는 선택한 LLM 상호작용에 대한 상세 정보가 표시됩니다.참고:새로 수집된 트레이스가 ‘트레이스’ 페이지에 표시되지만, LLM 작업 보기에 데이터가 생성되어 반영되기까지는 최대 1분 정도 걸릴 수 있습니다.
LLM 작업 보기 정보
LLM 작업 보기에서는 다음과 같은 정보를 제공합니다:
| 매개변수 | 설명 |
|---|---|
| 모델 이름 | 예를 들어, 상호작용에 사용된 구체적인 gpt-4 LLM 모델은 또는 claude-3-opus등입니다. |
| 입력 프롬프트 | LLM에 전송된 전체 프롬프트 또는 쿼리(시스템 메시지나 컨텍스트 포함). |
| 출력 응답 | LLM이 생성한 전체 응답. |
| 입력 토큰 | 입력 프롬프트에 포함된 토큰의 수. |
| 출력 토큰 | 생성된 응답에 포함된 토큰의 수. |
| 총 토큰 수 | 입력 토큰과 출력 토큰의 합계. |
| 입력 비용 | 입력 토큰을 처리하는 데 소요된 비용. |
| 출력 비용 | 출력 토큰을 생성하는 데 소요된 비용. |
| 총 비용 | 입력 비용과 출력 비용의 합계인 LLM 상호작용의 총 비용. |
| 지속 기간 | LLM이 요청을 처리하고 응답을 생성하는 데 걸리는 시간. |
| 온도 | LLM 호출에 사용되는 샘플링 온도로, 출력의 무작위성을 조절합니다. |
| 최대 토큰 | 응답에 허용되는 토큰의 최대 개수. |
| 상위 P | 출력 다변성을 제어하는 데 사용되는 코어 샘플링 매개변수. |
| 빈도 페널티 | 출력에서 토큰의 중복을 줄이기 위해 적용된 페널티입니다. |
| 존재 페널티 | 이 페널티는 모델이 새로운 주제에 대해 이야기하도록 유도하기 위해 적용되었습니다. |

LLM 작업 보기의 장점
LLM 작업 보기는 다음과 같은 기능을 제공합니다:
- 문제나 예상치 못한 동작을 파악하기 위해 정확한 프롬프트와 응답을 검토하여 LLM 상호작용을 디버깅하십시오.
- 개별 LLM 호출에 대한 토큰 사용량과 비용을 분석하여 비용 절감 기회를 파악함으로써 비용을 최적화합니다.
- 애플리케이션 추적 내의 LLM 작업에 대한 지연 시간과 응답 시간을 추적하여 성능을 모니터링하십시오.
- 각 LLM 호출에 사용된 매개변수를 검토하여 모델의 동작을 파악하고, 이러한 매개변수가 출력에 어떤 영향을 미치는지 이해하십시오.
- 상류 및 하류 호출을 포함한 전체 애플리케이션 추적 정보의 맥락에서 LLM 상호작용을 확인하세요.
LLM 진행 상황 보기
‘궤적(Trajectory) ’ 보기를 사용하여 에이전트 또는 LLM 호출의 모든 단계를 확인해 보세요. 에이전트 또는 LLM 호출이 포함된 트레이스를 열면, ‘Trajectory’ 보기를 통해 모든 프롬프트, 도구 호출 및 모델 응답이 포함된 전체 실행 트레이스를 확인할 수 있습니다.
이 화면에서는 각 에이전트 작업을 번호가 매겨진 작업 항목으로 표시합니다. 검색 가능한 목록을 사용하여 원하는 작업으로 이동할 수 있으며, 작업 상세 패널을 통해 해당 작업의 전체 내용을 확인할 수 있습니다.
LLM 궤적 보기 열기
‘궤적’ 보기를 열려면 다음 단계를 따르십시오:
- Instana UI의 탐색 메뉴에서 선택합니다.
- LLM 호출이 포함된 트레이스를 클릭하세요.
- 헤더 내비게이션에서 ‘궤적’ 탭을 클릭합니다. 보기가 ‘작업 계층 구조’ 보기에서 ‘경로’ 보기로 전환됩니다.
방금 입력한 트레이스가 표시됩니다. 다만, ‘궤적(Trajectory) ’ 보기의 경우 해당 데이터를 생성하고 표시하는 데 최대 1분이 소요될 수 있습니다. {: note}
LLM 경로 보기 정보
LLM 경로 보기에서는 다음과 같은 정보를 제공합니다:
| 매개변수 | 설명 |
|---|---|
| 태스크 이름 | 주석 추가 단계가 포함된 에이전트 작업의 이름. |
| 하위 작업명 | 주석 단계 내 개별 LLM 하위 호출의 이름. |
| 시작 시간 | LLM 하위 공모가 시작된 날짜와 시간. |
| 종료 시간 | LLM 하위 공모가 종료된 날짜와 시간. |
| 지속 기간 | LLM 하위 호출의 총 실행 시간(밀리초 단위). |
| 입력 토큰 | 이 LLM 하위 호출에 대해 모델이 수신하는 입력 프롬프트 내 토큰의 수입니다. |
| 출력 토큰 | 이 LLM 하위 호출에 대해 모델이 생성한 응답에 포함된 토큰 수입니다. |
| 총 토큰 수 | LLM 하위 호출에 대한 입력 및 출력 토큰의 합계. |
| 사용자 메시지 | 사용자가 LLM에 보내는 프롬프트 또는 쿼리. 이 뷰는 콘텐츠 유형에 따라 해당 콘텐츠를 일반 텍스트, JSON 또는 서식이 지정된 마크다운 형식으로 표시합니다. |
| 어시스턴트 응답 | 이 LLM 하위 호출에 대해 모델이 생성한 전체 응답입니다. |
| 도구 호출 이름 | 대화 턴 중에 어시스턴트가 호출하는 도구의 이름. |
| 도구 호출 인수 | 어시스턴트가 도구로 전달하는 인수가 서식이 적용된 JSON 스니펫 형태로 표시됩니다. |
| 도구 응답 | 어시스턴트의 도구 호출 후 해당 도구가 반환하는 결과. |
| 입력 | LLM 하위 호출의 전체 입력 페이로드. 이 페이로드는 ‘서식 지정 모드’(키-값 목록) 또는 ‘ JSON 모드’(원시 JSON )로 볼 수 있습니다. |
| 출력 | LLM 하위 호출의 전체 출력 페이로드입니다. 이 페이로드는 ‘서식 지정 모드’(키-값 목록) 또는 ‘ JSON 모드’(원시 JSON )로 볼 수 있습니다. |
| LLM 호출 | 이 작업이 수행하는 LLM 호출 횟수. |
| 도구 호출 | 작업이 호출하는 툴 호출 횟수. |
| 서브태스크 | 해당 작업 내의 하위 작업 수. |

LLM 경로 보기의 장점
LLM 경로 보기를 통해 에이전트 실행의 모든 단계를 상세하게 파악할 수 있습니다. 이 보기를 사용하여 다음을 수행할 수 있습니다.
- 에이전트 실행 디버깅 : 프롬프트, 도구 호출 및 모델 응답의 정확한 순서를 따라가며, 에이전트가 예상된 동작에서 벗어난 지점이나 잘못된 결과를 산출한 지점을 파악합니다.
- 도구 상호작용 검사 : 각 도구에 전달된 인자와 각 도구가 반환한 응답을 검토하여, 에이전트 실행 과정에서 발생한 도구 오류나 잘못 사용된 매개변수를 파악할 수 있습니다.
- 단계별 토큰 사용량 모니터링 : 각 LLM 하위 호출 시 입력 및 출력 토큰 수를 추적하여, 에이전트의 실행 경로에서 토큰 사용량이 가장 많은 단계를 파악합니다.
- 작업 소요 시간 분석 : 각 작업 및 LLM 하위 호출의 시작 시간, 종료 시간, 소요 시간을 검토하여 에이전트 진행 경로 전반에 걸친 지연 병목 현상을 파악합니다.
- 에이전트의 추론 과정 파악: 사용자 메시지, 어시스턴트의 응답, 도구 결과 등 전체 메시지 시퀀스를 검토하여 모델이 작업의 각 단계에서 어떻게 추론했는지 파악합니다.
- 에이전트 컨텍스트 추적 : 전체 작업 계층 구조 내에서 각 어노테이션 단계를 확인하고, 상위 작업의 입력, 출력, 그리고 뷰에서 집계하는 메트릭(예: LLM 호출 횟수, 도구 호출 횟수, 총 토큰 수 등)을 살펴봅니다.