上下文无界:面向大规模 AI 推理的高性能 KV 缓存平台
本文提出了一种经过验证的参考架构,将用于分布式 KV 缓存管理的 NVIDIA Dynamo、高性能共享存储层 IBM Storage Scale Erasure Coding Edition(ECE)、Supermicro Petascale 服务器以及 NVIDIA Spectrum-X 以太网相结合,以应对大规模生成式 AI 和智能体式 AI 推理部署中键值(KV)缓存管理这一关键基础设施挑战。本文提供了从小型概念验证环境到大型企业级 AI 工厂的多种部署规模方案,展示了基于共享存储的 KV 缓存基础设施如何为大规模推理部署提供可扩展且经济高效的解决方案。