사용자 정의 기반 모델의 특성 및 매개변수
사용자 정의 기반 모델의 매개변수를 설정하고 조정하여 해당 동작을 정의할 수 있습니다.
사용자 정의 기반 모델의 글로벌 매개변수
글로벌 매개변수를 사용하여 사용자 정의 기반 모델을 배치할 수 있습니다. 다음 표에 지정된 범위 내에서 기본 모델 매개변수의 값을 설정해야 합니다. 그렇게 하지 않으면 배치가 실패할 수 있으며 추론이 가능하지 않습니다. 모델 매개변수의 기본값으로 인해 오류가 발생하는 경우 관리자에게 문의하여 watsonxaiifm CR에서 모델의 레지스트리를 수정하십시오.
모든 모델에 적용되는 매개변수
지정된 값 범위 내에서 다음 글로벌 매개변수를 사용하여 사용자 정의 기반 모델을 배치할 수 있습니다.
| 매개변수 | 유형 | 값의 범위 | 기본값 | 설명 |
|---|---|---|---|---|
시퀀스 최대 개수(max_num_seqs) |
숫자 | max_num_seqs >= 1 |
그림 16 | 추론 중에 병렬로 처리되는 시퀀스(요청)의 최대 개수를 지정합니다. 값이 높을수록 처리량은 증가하지만, 더 많은 KV 캐시 메모리가 필요합니다. |
최대 모델 길이(max_model_length) |
숫자 | max_model_length >= 20; max_model_length <= model_context_length x max_num_seqs <= 사용 가능한 KV 캐시 메모리 |
2048 | 시퀀스당 토큰의 최대 총 개수(입력 + 출력)를 지정합니다. max_num_seqs모델의 컨텍스트 길이 범위 내에 있어야 하며, 의 값에 따라 선택되어야 합니다. 이 두 매개변수는 모두 KV 캐시 메모리 사용량에 영향을 미칩니다. |
함수(functions) |
문자열 | 해당사항 없음 | 해당 functions 필드가 지정되지 않은 경우, 모델은 기본적으로 텍스트 생성 및 텍스트 채팅(채팅 템플릿이 있는 경우)을 수행합니다. - 모델에 채팅 템플릿이 포함되어 있지 않은 경우, 기본 작업은 텍스트 생성입니다. - 모델에 채팅 템플릿이 포함되어 있는 경우, 기본 작업은 텍스트 생성 및 텍스트 채팅입니다. |
모델의 기능을 명시하십시오. 예를 들어: image_chat, audio_chat, embedding, 또는 rerank. 먼저 모델 카드에서 사용할 수 있는 기능을 확인해야 합니다. |
Max Concurrent Requests(max_concurrent_requests) 및 Max Batch size(max_batch_size) 매개변수의 값은 이전 릴리스에 배포되었으며 소프트웨어 사양을 watsonx-cfm-caikit-1.0 사용하는 모델에서만 사용됩니다. 이 소프트웨어 사양은 신규 배포에는 적용되지 않습니다.
자세한 매개변수 설명은 사용자 정의 기반 모델의 글로벌 매개변수에 대한 특성을 참조하십시오.
사용자 정의 기반 모델에 대한 글로벌 매개변수의 특성
사용자 정의 기반 모델의 글로벌 매개변수에 대해 다음 특성을 사용할 수 있습니다.
| 특성 | 유형 | 필수 또는 선택사항 | 설명 |
|---|---|---|---|
name |
문자열 | 필수 | 매개변수의 이름을 지정하려면 이 특성을 사용하십시오. |
default |
문자열, 숫자, 부울 | 필수 | 매개변수의 기본값을 지정하려면 이 특성을 사용하십시오. |
min |
숫자 | 선택적 | 이 특성을 사용하여 파머의 최소값을 지정하십시오. min 값은 입력된 값보다 작거나 같아야 합니다. |
max |
숫자 | 선택적 | 이 특성을 사용하여 매개변수의 최대값을 지정하십시오. max 값은 입력된 값보다 크거나 같아야 합니다. |
options |
문자열, 숫자 | 선택적 | 이 특성을 사용하여 매개변수에 대해 선택할 옵션 목록을 지정하십시오. 옵션 값의 유형은 매개변수 값과 동일해야 합니다. 선택한 값은 options 목록 내에 있어야 합니다. |
- 시스템 관리자가 모델 등록 단계에서 기본 모델 매개변수를 설정하더라도, 생성 단계나 업데이트 과정에서 이를 재정의할 수 있습니다.
- 시스템 관리자가 모델 등록 단계에서 기본 매개변수를 설정하지 않으면, ` watsonx `가 생성 단계에서 기본 매개변수를 설정합니다. 그런 다음 업데이트 중에 이를 대체할 수 있습니다.
- 시계열 모델은 매개변수를 전혀 사용하지 않습니다. 사용자 정의 시계열 모델을 배포할 때는 어떤 매개변수도 지정하지 마십시오. 사용자 정의 시계열 모델을 배포할 때 매개변수를 지정하더라도 아무런 효과가 없습니다.
- 사용자 정의 추론 런타임 이미지를 사용하는 모델은 배포 생성 단계에서 설정된 매개변수를 무시합니다. MLOps 엔지니어는 런타임 정의를 생성할 때나 모델 등록 과정에서 매개변수를 설정해야 합니다. 또한, 허용되는 매개변수 목록은 표준 추론 런타임을 사용하는 모델에서 사용하는 매개변수 목록과 다를 수 있습니다.
반복적인 추론 시나리오에서 토큰 소비를 줄이고 추론 속도를 높이기 위해, vLLM 런타임 엔진을 사용하는 모델은 기본적으로 접두사 캐싱이 활성화되어 true 있습니다. false사용 사례가 다르거나 캐시 사용량이 과도하게 많거나 OOM(메모리 부족) 오류와 같은 문제가 발생하는 경우, 모델 매개변수에 매개변수를 enable_prefix_caching 추가하고 그 값을 로 설정하십시오.
채팅 API가 있는 모델에만 적용되는 매개변수
이 선택적 매개변수는 채팅 API를 갖추고 있으며 vLLM 런타임 엔진을 사용하는 모델에만 적용됩니다.
또한, 이러한 매개변수는 모델을 배포하거나 배포된 모델을 프로그래밍 방식으로 업데이트할 때만 사용할 수 있습니다:
| 매개변수 | 유형 | 값의 범위 | 기본값 | 설명 |
|---|---|---|---|---|
| 파서 이름 ( tool_call_parser) |
문자열 | 모델과 일치하는 도구 파서 이름 | 해당사항 없음 | 추론 단계에서 사용자가 제공한 도구 목록에서 자동으로 선택할 수 있도록 합니다. 사용 가능한 파서 목록은 vLLM 문서 에서 확인할 수 있습니다 |
| 채팅 템플릿 파일 ( chat_template) |
문자열 | 템플릿 파일 이름 | 해당사항 없음 | 모델과 함께 제공되는 기본 채팅 템플릿을 재정의합니다. 자세한 내용은 ‘저장소 설정 및 모델 업로드’를 참조하세요. |