전용 GPU에 커스텀 파운데이션 모델을 배포하기 위한 요구 사항

사용자 지정 파운데이션 모델을 배포하는 데 사용할 수 있는 파운데이션 모델 watsonx.ai 성능 향상 설정 및 기능에 대해 살펴보세요.

사용자 지정 파운데이션 모델을 배포할 때는 다음 요구 사항을 고려하세요:

지원되는 모델 아키텍처

참고:

다양한 소프트웨어 사양을 배포에 사용할 수 있습니다:

  • watsonx-cfm-caikit-1.1 소프트웨어 사양은 vLLM 런타임 엔진을 기반으로 합니다.
  • watsonx-tsfm-runtime-1.0 소프트웨어 사양은 시계열 모델용으로 설계되었습니다. watsonx-tsfm-runtime-1.0 추론 런타임을 기반으로 합니다.

다음 표에서는 지원되는 모델 아키텍처, 사용 가능한 양자화 방법, 다중 GPU 지원 및 사용 가능한 배포 구성에 대한 정보를 제공합니다. 또한 모델을 배포할 때 사용할 수 있는 소프트웨어 사양과 나열된 각 아키텍처 유형에 속하는 몇 가지 예시 기초 모델의 이름도 제공됩니다.

범용 모델:

범용 모델에 대한 지원 모델 아키텍처, 양자화 방법, 병렬 텐서 및 배포 구성
모델 제품군 기초 모델 예제 지원되는 정량화 방법 병렬 텐서(다중 GPU 지원) 배포 구성
bloom bigscience/bloom-3b, bigscience/bloom-560m 해당사항 없음 소형, 중형, 대형
exaone lgai-exaone/exaone-3.0-7.8B-Instruct 해당사항 없음 아니오 소형
falcon tiiuae/falcon-7b 해당사항 없음 소형, 중형, 대형
gemma google/gemma-2b 해당사항 없음 소형, 중형, 대형
gemma2 google/gemma-2-9b 해당사항 없음 소형, 중형, 대형
gemma3 google/gemma-3-27b-it 해당사항 없음 소형, 중형, 대형
gpt_bigcode bigcode/starcoder
bigcode/gpt_bigcode-santacoder
gptq 소형, 소형, 중형, 대형
gpt_neox rinna/japanese-gpt-neox-small
EleutherAI/pythia-12b, databricks/dolly-v2-12b
해당사항 없음 소형, 중형, 대형
gptj EleutherAI/gpt-j-6b 해당사항 없음 아니오 소형
gpt2 gpt2
gpt2-xl
해당사항 없음 소형, 중형, 대형
granite ibm-granite/granite-3.0-8b-instruct, ibm-granite/granite-3b-code-instruct-2k, granite-8b-code-instruct, granite-7b-lab 해당사항 없음 아니오 소형
jais core42/jais-13b 해당사항 없음 소형, 중형, 대형
llama Deepseek-R1 (distilled variant)
meta-llama/Meta-Llama-3-8B
meta-llama/Meta-Llama-3.1-8B-Instruct
llama-2-13b-chat-hf
TheBloke/Llama-2-7B-Chat-AWQ
ISTA-DASLab/Llama-2-7b-AQLM-2Bit-1x16-hf
gptq 소형, 중형, 대형
mistral mistralai/Mistral-7B-v0.3, neuralmagic/OpenHermes-2.5-Mistral-7B-marlin 해당사항 없음 아니오 소형
mixtral TheBloke/Mixtral-8x7B-v0.1-GPTQ
mistralai/Mixtral-8x7B-Instruct-v0.1
gptq 아니오 소형
nemotron nvidia/Minitron-8B-Base 해당사항 없음 소형, 중형, 대형
olmo allenai/OLMo-1B-hf
allenai/OLMo-7B-hf
해당사항 없음 소형, 중형, 대형
persimmon adept/persimmon-8b-base
adept/persimmon-8b-chat
해당사항 없음 소형, 중형, 대형
phi microsoft/phi-2
microsoft/phi-1_5
해당사항 없음 소형, 중형, 대형
phi3 microsoft/Phi-3-mini-4k-instruct 해당사항 없음 소형, 중형, 대형
qwen DeepSeek-R1 (distilled variant) 해당사항 없음 소형, 중형, 대형
qwen2 Deepseek-R1 (distilled variant)
Qwen/Qwen2-7B-Instruct-AWQ
AWQ 소형, 중형, 대형
qwen3 qwen/qwen3-32B 해당사항 없음 소형, 중형, 대형
참고:

MosaicML 제품군의 모델을 사용하려면 관리자가 사용자 지정 추론 런타임을 사용하여 해당 모델을 배포해야 합니다.

시계열 모델:

시계열 모델에 지원되는 모델 아키텍처, 양자화 방법, 병렬 텐서 및 배포 구성
모델 제품군 기초 모델 예제 지원되는 정량화 방법 병렬 텐서(다중 GPU 지원) 배포 구성
tinytimemixer ibm-granite/granite-timeseries-ttm-r2 해당사항 없음 해당사항 없음 소형, 중형, 대형, 특대형

모델 임베딩 및 재순위 지정:

지원되는 모델 아키텍처: 임베딩 및 재순위 지정 모델
모델 제품군 기초 모델 예제 의미 기반 검색 지원 배포 구성
BGE BAAI/bge-reranker-v2-m3 재순위 지정 소형, 중형, 대형
E5 intfloat/multilingual-e5-large 내장 및 재순위 지정 소형, 중형, 대형
granite ibm/granite-embedding-107m-multilingual, ibm/granite-embedding-278m-multilingual 임베딩 소형, 중형, 대형
Jina Reranker jinaai/jina-reranker-v2-base-multilingual 재순위 지정 소형, 중형, 대형
MiniLM cross-encoder/ms-marco-minilm-l-12-v2 재순위 지정 소형, 중형, 대형
MiniLM sentence-transformers/all-minilm-l6-v2 내장 및 재순위 지정 소형, 중형, 대형
Qwen Qwen/Qwen3-Embedding-0.6B 내장 및 재순위 지정 소형, 중형, 대형
slate ibm/slate-125m-english-rtrvr, ibm/slate-125m-english-rtrvr-v2, ibm/slate-30m-english-rtrvr, ibm/slate-30m-english-rtrvr-v2 내장 및 재순위 지정 소형, 중형, 대형
중요:
  • 관리자는 자동 음성 인식(ASR) 모델을 전체 배포용으로만 추가할 수 있습니다.
  • IBM ‘지원되는 모델 아키텍처’, ‘양자화 방법’, ‘병렬 텐서’, ‘배포 구성’ 및 ‘소프트웨어 사양 ’ 표에 나열된 모델 아키텍처에 대해서만 인증합니다. 대체 아키텍처가 있는 모델은 vLLM 런타임에서 지원되는 경우 사용할 수 있지만, IBM 에서는 지원되지 않는 아키텍처 또는 호환되지 않는 기능이 있는 파운데이션 모델을 배포하여 발생하는 배포 실패를 지원하지 않습니다.
  • 모델 아키텍처가 지원되지 않는 경우, MLOps 엔지니어가 모델 아키텍처에 맞게 사용자 지정 추론 런타임 이미지를 추가하고 배포를 위한 모델 자산을 준비할 수 있습니다. LoRA 기법을 사용하여 이러한 모델을 미세 조정하면 배포할 수 없다는 점에 유의하세요.

사전 정의된 하드웨어 사양

참고:

시계열 모델의 경우 CPU 기반 하드웨어 사양을 사용합니다.

CPU 기반 하드웨어 사양

다음은 CPU 기반 하드웨어 사양 목록입니다:

  • S2 vCPU 및 8GB 메모리
  • M: 4 vCPUs 및 16GB 메모리
  • L8 vCPUs 및 32GB 메모리
  • XL: 16 vCPUs 및 64GB 메모리

시계열 모델의 경우 최대 동시 사용자 수와 페이로드 특성에 따라 모델에 하드웨어 사양을 할당합니다:

시계열 모델에 CPU 기반 하드웨어 사양을 할당하기 위한 권장 사항
단변량 시계열 다변량 시계열(계열 x 대상) S M L XL
1000 23x100 6 12 25 50
500 15x80 1,000만 21개 42 85
250 15x40 13 26 53 106
125 15x20 13 27 54 109
60 15x10 14 28 56 112
6시간에서 30분 15x5 14 28 56 113

범용 모델(GPU 기반 하드웨어 사양)

범용 모델의 경우 사용 가능한 추론 런타임은 이러한 GPU 기반 하드웨어 사양을 지원합니다:

  • WX-S: gPU 1개, CPU 2개, 메모리 60GB
  • WX-MgPU 2개, CPU 3개, 메모리 120GB
  • WX-L: 4개의 GPU, 5개의 CPU, 240GB 메모리
  • WX-XL8개의 GPU, 9개의 CPU, 600GB 메모리

이러한 사전 정의된 하드웨어 사양은 이러한 표준 지원 하드웨어 구성에만 적용됩니다:

  • NVIDIA A100 80GB GPU 메모리
  • 80GB GPU 메모리가 탑재된 NVIDIA H100

GPU 구성이 다른 경우(예: NVIDIA L40S, GPU 메모리 48GB) 사용자 지정 하드웨어 사양을 만들어야 합니다. 자세한 내용은 사용자 지정 하드웨어 사양 만들기를 참조하세요.

모델이 학습된 파라미터의 수에 따라 사용자 지정 파운데이션 모델에 하드웨어 사양을 할당합니다:

  • 20B 매개변수: ' WX-S'
  • 40B 매개변수: ' WX-M'
  • 80B 매개변수: ' WX-L'
  • 200B 매개변수 ' WX-XL'
참고:

일부 모델 아키텍처는 하나의 GPU만 지원하므로 파라미터 수에 관계없이 ' WX-S 하드웨어 사양을 할당해야 합니다. 정량화된 모델에는 미리 정의된 하드웨어 사양을 사용할 수 없습니다. 정량화된 모델 및 기타 비표준의 경우 사용자 지정 하드웨어 사양을 사용하세요. 자세한 내용은 사용자 지정 하드웨어 사양 만들기를 참조하세요.

다음 단계