전용 GPU에 커스텀 파운데이션 모델을 배포하기 위한 요구 사항
사용자 지정 파운데이션 모델을 배포하는 데 사용할 수 있는 파운데이션 모델 watsonx.ai 성능 향상 설정 및 기능에 대해 살펴보세요.
사용자 지정 파운데이션 모델을 배포할 때는 다음 요구 사항을 고려하세요:
- 배포하려는 모델이 지원되는 아키텍처를 사용하는지 확인하세요.
- 사용자 지정 파운데이션 모델을 배포하기 위한 하드웨어 사양을 선택합니다.
지원되는 모델 아키텍처
다양한 소프트웨어 사양을 배포에 사용할 수 있습니다:
watsonx-cfm-caikit-1.1소프트웨어 사양은vLLM런타임 엔진을 기반으로 합니다.watsonx-tsfm-runtime-1.0소프트웨어 사양은 시계열 모델용으로 설계되었습니다.watsonx-tsfm-runtime-1.0추론 런타임을 기반으로 합니다.
다음 표에서는 지원되는 모델 아키텍처, 사용 가능한 양자화 방법, 다중 GPU 지원 및 사용 가능한 배포 구성에 대한 정보를 제공합니다. 또한 모델을 배포할 때 사용할 수 있는 소프트웨어 사양과 나열된 각 아키텍처 유형에 속하는 몇 가지 예시 기초 모델의 이름도 제공됩니다.
범용 모델:
| 모델 제품군 | 기초 모델 예제 | 지원되는 정량화 방법 | 병렬 텐서(다중 GPU 지원) | 배포 구성 |
|---|---|---|---|---|
bloom |
bigscience/bloom-3b, bigscience/bloom-560m |
해당사항 없음 | 예 | 소형, 중형, 대형 |
exaone |
lgai-exaone/exaone-3.0-7.8B-Instruct |
해당사항 없음 | 아니오 | 소형 |
falcon |
tiiuae/falcon-7b |
해당사항 없음 | 예 | 소형, 중형, 대형 |
gemma |
google/gemma-2b |
해당사항 없음 | 예 | 소형, 중형, 대형 |
gemma2 |
google/gemma-2-9b |
해당사항 없음 | 예 | 소형, 중형, 대형 |
gemma3 |
google/gemma-3-27b-it |
해당사항 없음 | 예 | 소형, 중형, 대형 |
gpt_bigcode |
bigcode/starcoder bigcode/gpt_bigcode-santacoder |
gptq |
예 | 소형, 소형, 중형, 대형 |
gpt_neox |
rinna/japanese-gpt-neox-small EleutherAI/pythia-12b, databricks/dolly-v2-12b |
해당사항 없음 | 예 | 소형, 중형, 대형 |
gptj |
EleutherAI/gpt-j-6b |
해당사항 없음 | 아니오 | 소형 |
gpt2 |
gpt2 gpt2-xl |
해당사항 없음 | 예 | 소형, 중형, 대형 |
granite |
ibm-granite/granite-3.0-8b-instruct, ibm-granite/granite-3b-code-instruct-2k, granite-8b-code-instruct, granite-7b-lab |
해당사항 없음 | 아니오 | 소형 |
jais |
core42/jais-13b |
해당사항 없음 | 예 | 소형, 중형, 대형 |
llama |
Deepseek-R1 (distilled variant) meta-llama/Meta-Llama-3-8B meta-llama/Meta-Llama-3.1-8B-Instruct llama-2-13b-chat-hf TheBloke/Llama-2-7B-Chat-AWQ ISTA-DASLab/Llama-2-7b-AQLM-2Bit-1x16-hf |
gptq |
예 | 소형, 중형, 대형 |
mistral |
mistralai/Mistral-7B-v0.3, neuralmagic/OpenHermes-2.5-Mistral-7B-marlin |
해당사항 없음 | 아니오 | 소형 |
mixtral |
TheBloke/Mixtral-8x7B-v0.1-GPTQ mistralai/Mixtral-8x7B-Instruct-v0.1 |
gptq |
아니오 | 소형 |
nemotron |
nvidia/Minitron-8B-Base |
해당사항 없음 | 예 | 소형, 중형, 대형 |
olmo |
allenai/OLMo-1B-hf allenai/OLMo-7B-hf |
해당사항 없음 | 예 | 소형, 중형, 대형 |
persimmon |
adept/persimmon-8b-base adept/persimmon-8b-chat |
해당사항 없음 | 예 | 소형, 중형, 대형 |
phi |
microsoft/phi-2 microsoft/phi-1_5 |
해당사항 없음 | 예 | 소형, 중형, 대형 |
phi3 |
microsoft/Phi-3-mini-4k-instruct |
해당사항 없음 | 예 | 소형, 중형, 대형 |
qwen |
DeepSeek-R1 (distilled variant) |
해당사항 없음 | 예 | 소형, 중형, 대형 |
qwen2 |
Deepseek-R1 (distilled variant) Qwen/Qwen2-7B-Instruct-AWQ |
AWQ |
예 | 소형, 중형, 대형 |
qwen3 |
qwen/qwen3-32B |
해당사항 없음 | 예 | 소형, 중형, 대형 |
MosaicML 제품군의 모델을 사용하려면 관리자가 사용자 지정 추론 런타임을 사용하여 해당 모델을 배포해야 합니다.
시계열 모델:
| 모델 제품군 | 기초 모델 예제 | 지원되는 정량화 방법 | 병렬 텐서(다중 GPU 지원) | 배포 구성 |
|---|---|---|---|---|
tinytimemixer |
ibm-granite/granite-timeseries-ttm-r2 |
해당사항 없음 | 해당사항 없음 | 소형, 중형, 대형, 특대형 |
모델 임베딩 및 재순위 지정:
| 모델 제품군 | 기초 모델 예제 | 의미 기반 검색 지원 | 배포 구성 |
|---|---|---|---|
BGE |
BAAI/bge-reranker-v2-m3 |
재순위 지정 | 소형, 중형, 대형 |
E5 |
intfloat/multilingual-e5-large |
내장 및 재순위 지정 | 소형, 중형, 대형 |
granite |
ibm/granite-embedding-107m-multilingual, ibm/granite-embedding-278m-multilingual |
임베딩 | 소형, 중형, 대형 |
Jina Reranker |
jinaai/jina-reranker-v2-base-multilingual |
재순위 지정 | 소형, 중형, 대형 |
MiniLM |
cross-encoder/ms-marco-minilm-l-12-v2 |
재순위 지정 | 소형, 중형, 대형 |
MiniLM |
sentence-transformers/all-minilm-l6-v2 |
내장 및 재순위 지정 | 소형, 중형, 대형 |
Qwen |
Qwen/Qwen3-Embedding-0.6B |
내장 및 재순위 지정 | 소형, 중형, 대형 |
slate |
ibm/slate-125m-english-rtrvr, ibm/slate-125m-english-rtrvr-v2, ibm/slate-30m-english-rtrvr, ibm/slate-30m-english-rtrvr-v2 |
내장 및 재순위 지정 | 소형, 중형, 대형 |
- 관리자는 자동 음성 인식(ASR) 모델을 전체 배포용으로만 추가할 수 있습니다.
- IBM ‘지원되는 모델 아키텍처’, ‘양자화 방법’, ‘병렬 텐서’, ‘배포 구성’ 및 ‘소프트웨어 사양 ’ 표에 나열된 모델 아키텍처에 대해서만 인증합니다. 대체 아키텍처가 있는 모델은 vLLM 런타임에서 지원되는 경우 사용할 수 있지만, IBM 에서는 지원되지 않는 아키텍처 또는 호환되지 않는 기능이 있는 파운데이션 모델을 배포하여 발생하는 배포 실패를 지원하지 않습니다.
- 모델 아키텍처가 지원되지 않는 경우, MLOps 엔지니어가 모델 아키텍처에 맞게 사용자 지정 추론 런타임 이미지를 추가하고 배포를 위한 모델 자산을 준비할 수 있습니다. LoRA 기법을 사용하여 이러한 모델을 미세 조정하면 배포할 수 없다는 점에 유의하세요.
사전 정의된 하드웨어 사양
시계열 모델의 경우 CPU 기반 하드웨어 사양을 사용합니다.
CPU 기반 하드웨어 사양
다음은 CPU 기반 하드웨어 사양 목록입니다:
S2 vCPU 및 8GB 메모리M: 4 vCPUs 및 16GB 메모리L8 vCPUs 및 32GB 메모리XL: 16 vCPUs 및 64GB 메모리
시계열 모델의 경우 최대 동시 사용자 수와 페이로드 특성에 따라 모델에 하드웨어 사양을 할당합니다:
| 단변량 시계열 | 다변량 시계열(계열 x 대상) | S | M | L | XL |
|---|---|---|---|---|---|
| 1000 | 23x100 | 6 | 12 | 25 | 50 |
| 500 | 15x80 | 1,000만 | 21개 | 42 | 85 |
| 250 | 15x40 | 13 | 26 | 53 | 106 |
| 125 | 15x20 | 13 | 27 | 54 | 109 |
| 60 | 15x10 | 14 | 28 | 56 | 112 |
| 6시간에서 30분 | 15x5 | 14 | 28 | 56 | 113 |
범용 모델(GPU 기반 하드웨어 사양)
범용 모델의 경우 사용 가능한 추론 런타임은 이러한 GPU 기반 하드웨어 사양을 지원합니다:
WX-S: gPU 1개, CPU 2개, 메모리 60GBWX-MgPU 2개, CPU 3개, 메모리 120GBWX-L: 4개의 GPU, 5개의 CPU, 240GB 메모리WX-XL8개의 GPU, 9개의 CPU, 600GB 메모리
이러한 사전 정의된 하드웨어 사양은 이러한 표준 지원 하드웨어 구성에만 적용됩니다:
- NVIDIA A100 80GB GPU 메모리
- 80GB GPU 메모리가 탑재된 NVIDIA H100
GPU 구성이 다른 경우(예: NVIDIA L40S, GPU 메모리 48GB) 사용자 지정 하드웨어 사양을 만들어야 합니다. 자세한 내용은 사용자 지정 하드웨어 사양 만들기를 참조하세요.
모델이 학습된 파라미터의 수에 따라 사용자 지정 파운데이션 모델에 하드웨어 사양을 할당합니다:
- 20B 매개변수: '
WX-S' - 40B 매개변수: '
WX-M' - 80B 매개변수: '
WX-L' - 200B 매개변수 '
WX-XL'
일부 모델 아키텍처는 하나의 GPU만 지원하므로 파라미터 수에 관계없이 ' WX-S 하드웨어 사양을 할당해야 합니다. 정량화된 모델에는 미리 정의된 하드웨어 사양을 사용할 수 없습니다. 정량화된 모델 및 기타 비표준의 경우 사용자 지정 하드웨어 사양을 사용하세요. 자세한 내용은 사용자 지정 하드웨어 사양 만들기를 참조하세요.