Konteks Tanpa Batas: Platform Cache KV Berkinerja Tinggi untuk Inferensi AI Skala Besar

Makalah ini memaparkan arsitektur referensi yang telah tervalidasi, yang menggabungkan NVIDIA Dynamo untuk pengelolaan cache kunci-nilai (KV) terdistribusi, IBM Storage Scale Erasure Coding Edition (ECE) sebagai lapisan penyimpanan bersama berkinerja tinggi, server Supermicro Petascale, dan NVIDIA Spectrum-X Ethernet, guna mengatasi tantangan infrastruktur penting dalam pengelolaan cache kunci-nilai (KV) pada penerapan inferensi AI generatif dan AI agen berskala besar. Makalah ini menyajikan berbagai opsi penentuan skala implementasi, mulai dari lingkungan uji konsep berskala kecil hingga pabrik AI perusahaan berskala besar, yang menunjukkan bahwa infrastruktur cache KV berbasis penyimpanan bersama menawarkan solusi yang dapat diskalakan dan hemat biaya untuk penerapan inferensi berskala besar.

Konteks Tanpa Batas: Platform Cache KV Berkinerja Tinggi untuk Inferensi AI Skala Besar