コンテキストの限界を超える:大規模AI推論のための高性能KVキャッシュプラットフォーム

この資料では、分散KVキャッシュ管理のためのNVIDIA Dynamo、高性能な共有ストレージ階層としてのIBM Storage Scale Erasure Coding Edition(ECE)、Supermicro Petascaleサーバー、NVIDIA Spectrum-Xイーサネットを組み合わせた検証済みのリファレンス・アーキテクチャーを提示し、大規模な生成AIおよびエージェント型AI推論のデプロイメントにおける重要なインフラストラクチャー課題であるキーバリュー(KV)キャッシュ管理に対処します。小規模な概念実証環境から大規模なエンタープライズAIファクトリーまで、さまざまなデプロイメント規模に対応するオプションを提供し、共有ストレージベースのKVキャッシュ・インフラストラクチャーが、大規模な推論デプロイメントへのスケーラブルでコスト効率の高い方法を提供することを実証しています。

コンテキストの限界を超える:大規模AI推論のための高性能KVキャッシュプラットフォーム