Contesto senza limiti: una piattaforma KV Cache ad alte prestazioni per l’inferenza AI su larga scala

Questo documento presenta un’architettura di riferimento convalidata che combina NVIDIA Dynamo per la gestione distribuita della KV Cache, IBM Storage Scale Erasure Coding Edition (ECE) come livello di storage condiviso ad alte prestazioni, server Supermicro Petascale e NVIDIA Spectrum-X Ethernet, per affrontare la sfida infrastrutturale critica della gestione della key-value (KV) cache nelle implementazioni di inferenza AI generativa e agentica su larga scala. Il documento presenta opzioni di dimensionamento che vanno da piccoli ambienti proof of concept fino a grandi ecosistemi AI aziendali, dimostrando che un’infrastruttura di KV Cache basata su storage condiviso offre un percorso scalabile ed efficiente in termini di costi per le implementazioni di inferenza su larga scala.

Contesto senza limiti: una piattaforma KV Cache ad alte prestazioni per l’inferenza AI su larga scala