Sans limites : une plateforme de cache KV haute performance pour l’inférence d’IA à grande échelle
Cet article présente une architecture de référence validée combinant NVIDIA Dynamo pour la gestion distribuée du cache clé-valeur, IBM Storage Scale Erasure Codage Edition (ECE) en tant que couche de stockage partagée haute performance, des serveurs Supermicro Petascale et NVIDIA Spectrum-X Ethernet pour relever le défi critique d'infrastructure de la gestion du cache clé-valeur dans les déploiements d'IA générative et d'IA agentique à grande échelle. L’article propose des options de dimensionnement du déploiement allant de petits environnements de preuve de concept à de grandes usines d’IA d’entreprise, démontrant que l’infrastructure de cache KV basée sur le stockage partagé offre un chemin évolutif et économique vers un déploiement d’inférence à grande échelle.