제한 없는 컨텍스트: 대규모 AI 추론을 위한 고성능 KV 캐시 플랫폼

이 백서에서는 대규모 생성형 AI 및 에이전틱 AI 추론 배포에서 핵심 인프라 과제인 키-값(KV) 캐시 관리 문제를 해결하기 위해 분산형 KV 캐시 관리를 위한 NVIDIA Dynamo, 고성능 공유 스토리지 계층인 IBM® Storage Scale ECE(Erasure Coding Edition), Supermicro Petascale 서버, NVIDIA Spectrum-X Ethernet을 결합한 검증된 참조 아키텍처를 제시합니다. 이 백서는 소규모 개념 증명 환경부터 대규모 엔터프라이즈 AI 팩토리에 이르기까지 다양한 배포 규모 옵션을 제공하며, 공유 스토리지 기반 KV 캐시 인프라가 대규모 추론 배포를 위한 확장 가능하고 비용 효율적인 경로를 제공한다는 점을 보여줍니다.

제한 없는 컨텍스트: 대규모 AI 추론을 위한 고성능 KV 캐시 플랫폼