MinIO telah mengembangkan sistem memcaching MemKV skala petabyte yang disesuaikan untuk GPU Nvidia, yang digunakan di atas platform penyimpanan objek AIStor.
Kluster GPU yang menjalankan inferensi membutuhkan memori bandwidth tinggi (HBM) untuk menyimpan konteks, token vektorisasi dan pasangan nilai kunci menengah (KV).Kaskade data ke CPU DRAM dan NVMe SSD, dikelola oleh Nvidia BlueField-4 (BF4) DPU. Ketika tingkat ini mencapai kapasitas, MinIO AIStor bertindak sebagai cadangan penyimpanan akhir.dan MemKV sesuai dengan standar untuk memberikan persisten, berbagi konteks di seluruh GPU cluster pada skala yang lebih tinggi.
AB Periasamy, co-founder dan co-CEO MinIO, berkomentar: "Industri telah mengoleskan kehilangan konteks selama bertahun-tahun karena, dalam skala kecil, Anda dapat menyerap pajak perhitungan ulang.Dengan kepadatan GPU yang tinggi saat ini untuk hyperscaler dan neocloud, ini tidak lagi layak.
Menghitung ulang konteks yang dihasilkan membuang daya; untuk cluster dengan ribuan GPU, itu menciptakan inefisiensi struktural mendasar.dan MemKV dirancang khusus untuk jalur data ini.
Untuk pertama kalinya, MinIO memungkinkan kumpulan konteks bersama untuk seluruh cluster GPU pada tingkat latensi mikrosekund yang cocok dengan alur kerja inferensi,Menghindari keterlambatan milidetik dari penyimpanan eksternal konvensionalTanpa cukup cache tingkat, GPU buang-buang sumber daya pada berulang konteks perhitungan ulang.
Dalam penyebaran 128 GPU dengan panjang konteks token 128K, MemKV meningkatkan time-to-first-token di bawah beban produksi dan meningkatkan pemanfaatan GPU dari 50% menjadi lebih dari 90%,menghasilkan estimasi penghematan biaya komputasi tahunan sebesar $ 2 juta.
MemKV mendukung Nvidia Dynamo dan NIXL alat caching. MemKV memberikan petabyte memori konteks bersama pada biaya tingkat SSD,pemisahan skala cache dari sumber daya komputasi GPUFitur utamanya tercantum di bawah ini:
-
Dukungan STX BF4 asli: Berjalan sebagai biner ARM64 dalam infrastruktur STX, tertanam dalam penyimpanan daripada server penyimpanan x86 terpisah.
-
Pengangkutan RDMA end-to-end: Memindahkan cache KV antara memori GPU dan NVMe melalui RDMA, melewati protokol penyimpanan file dan objek konvensional.
-
Ukuran blok yang dioptimalkan oleh GPU: Menggunakan blok 2 16 MB untuk permintaan throughput GPU, bukan blok penyimpanan 4 KB yang lama.
-
Kinerja kecepatan kawat: Dioptimalkan untuk Nvidia Spectrum-X Ethernet dan PCIe Gen6 untuk memaksimalkan throughput kain fisik.
MemKV secara langsung mentransfer data dari NVMe SSD ke pipa AI melalui RDMA, menghilangkan overhead HTTP, terjemahan sistem file dan server penyimpanan menengah.
MinIO mengkategorikan solusi memori konteks saingan menjadi dua jenis: NVMe lokal yang tidak dapat dibagikan (G3) dan penyimpanan bersama tujuan umum (G4).membedakan dirinya dari produk penyimpanan generik.
Perusahaan menekankan bahwa vendor lama G3.5 penawaran masih mempertahankan node protokol redundant, layanan metadata dan lapisan terjemahan file.Lapisan ini memastikan daya tahan dan konsistensi untuk data pelatihan dan bobot model, namun mereka tidak perlu untuk ephemeral, recomputable KV cache dioptimalkan untuk 2 ¢ 16 MB blok data.
Vendor hardware RAID GRAID dan perusahaan penyimpanan WEKA juga menyediakan solusi cache KV yang kompatibel dengan STX.Ruang palu, Hitachi Vantara, HPE, Lightbits/ScaleFlux, NetApp, Nutanix, Peak: AIO, Pliops dan VAST Data.
Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Direktur Strategi Global
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Situs web: www.qianxingdata.com/www.storagesserver.com
Fokus Bisnis:
Distribusi Produk ICT/Integrasi Sistem & Layanan/Solusi Infrastruktur
Dengan 20+ tahun pengalaman distribusi TI, kami bermitra dengan merek global terkemuka untuk memberikan produk yang dapat diandalkan dan layanan profesional.
¢Menggunakan Teknologi untuk Membangun Dunia yang Cerdas ¢Penyedia Layanan Produk ICT yang Anda Percayai!