VAST Data telah memperluas kemitraannya dengan AMD untuk memajukan infrastruktur AI untuk platform cloud dan perusahaan yang menjalankan pelatihan model, inferensi, generasi yang ditingkatkan pengambilan (RAG), dan beban kerja AI agentik. Tumpukan terintegrasi menyatukan VAST AI Operating System dengan prosesor AMD EPYC Generasi ke-6, GPU AMD Instinct, perangkat keras jaringan AMD, dan perangkat lunak ROCm.
Kolaborasi ini selaras dengan pergeseran industri besar: infrastruktur AI berevolusi melampaui kluster pelatihan saja untuk mendukung konteks persisten, inferensi konkurensi tinggi, dan alur kerja agen multi-putaran. Penerapan AI modern memprioritaskan pergerakan data yang efisien, manajemen cache KV yang dioptimalkan, pemanfaatan GPU yang lebih tinggi, dan akses latensi rendah ke model besar dan kumpulan data kontekstual.
Arsitektur Disaggregated Shared Everything (DASE) VAST berfungsi sebagai lapisan data bersama terpadu untuk lingkungan AI modern ini. Ini mengkonsolidasikan penyimpanan file dan objek, database, streaming peristiwa, dan layanan data inti di bawah satu namespace global, sambil memberikan multi-tenancy dan isolasi beban kerja untuk cloud AI yang menjalankan tugas pelanggan dan aplikasi bersamaan yang beragam.
AMD EPYC 9006 Memberdayakan Perangkat Keras VAST Generasi Berikutnya
VAST mengadopsi prosesor AMD EPYC 9006-seri Generasi ke-6 (Venice) untuk sistem CBox Generasi ke-6 dan EBox Generasi ke-3 mendatang, yang membentuk fondasi perangkat keras VAST AI Operating System. Platform EPYC 9006 memperkenalkan konektivitas PCIe Gen6 ke jajaran perangkat keras VAST, menggandakan bandwidth I/O per generasi.
Peningkatan ini meningkatkan throughput penyimpanan file dan objek serta menurunkan latensi untuk beban kerja database, data warehouse, dan streaming peristiwa yang didukung oleh VAST DataBase dan DataEngine. Untuk infrastruktur AI, bandwidth I/O yang ditingkatkan mengurangi hambatan di seluruh komputasi, jaringan, dan penyimpanan NVMe, menguntungkan pemuatan model, pipeline pengambilan, akses checkpoint, dan alur kerja cache KV eksternal yang melebihi batas memori GPU asli.
Arsitektur Referensi Tri-Player dengan AMD dan DriveNets
VAST, AMD, dan DriveNets bersama-sama membangun arsitektur referensi infrastruktur AI terpadu, menggabungkan infrastruktur AI Helios skala rak AMD, VAST AI OS, dan jaringan DriveNets AI Fabric. Kerangka kerja ini memberikan panduan penerapan standar untuk pelatihan AI, inferensi, pembelajaran penguatan, dan beban kerja cache KV, menyediakan praktik terbaik ukuran dan ketersediaan bagi perusahaan yang membangun pabrik AI dengan infrastruktur data bersama dan jaringan berkinerja tinggi.
VAST juga telah memperluas hubungan ekosistemnya dengan vendor inferensi TensorMesh dan EmbeddedLLM, berfokus pada arsitektur inferensi tingkat produksi untuk kasus penggunaan AI agentik, dengan detail integrasi dan peluncuran spesifik yang belum diungkapkan.
Offload Cache KV yang Dioptimalkan untuk Inferensi Konkurensi Tinggi
Inti dari kolaborasi yang diperbarui adalah offload cache KV yang ditingkatkan, memanfaatkan GPU AMD Instinct, AMD Infinity Context, perangkat lunak ROCm, dan VAST AI OS. Cache KV menyimpan data status perhatian yang dihasilkan inferensi untuk mempercepat interaksi multi-putaran dan beban kerja AI konteks panjang, namun ukuran cache yang besar dengan cepat mengonsumsi memori GPU yang terbatas.
Offloading atau tiering cache KV ke penyimpanan bersama berkinerja tinggi membebaskan memori GPU untuk tugas aktif sambil mempertahankan data kontekstual untuk permintaan inferensi berikutnya. Pengujian awal pada GPU AMD Instinct MI355X memberikan waktu-ke-token-pertama 9x lebih cepat dan throughput token 9,7x lebih tinggi untuk beban kerja AI agentik konkurensi tinggi melalui offload cache KV yang didukung VAST, dengan kinerja bervariasi berdasarkan basis perangkat keras, beban kerja, dan konfigurasi penyimpanan.
Selain itu, kebijakan siklus hidup otomatis VAST berlaku untuk data cache KV, memungkinkan kedaluwarsa dan penghapusan konten yang di-cache sesuai jadwal — fitur penting untuk menangani data inferensi yang sensitif, pribadi, atau diatur.
Interkoneksi Penyimpanan GPU Berkecepatan Tinggi melalui Pensando Pollara 400
Arsitektur ini menerapkan NIC AI AMD Pensando Pollara 400 untuk menghubungkan GPU AMD Instinct ke kluster penyimpanan VAST. Mendukung NFS melalui TCP dan RDMA, NIC memungkinkan transfer data GPU-ke-penyimpanan yang efisien, memberikan akses latensi rendah ke penyimpanan VAST berbasis NVMe untuk cache KV dan beban kerja inferensi umum.
Desain ini memisahkan penskalaan manajemen konteks dari batas memori GPU fisik. Alih-alih memperlakukan penyimpanan sebagai persistensi pasif, VAST memposisikan platformnya sebagai lapisan data dan eksekusi terpadu untuk manajemen model terdistribusi, database, streaming, aset file, dan konteks AI. Untuk penyedia cloud AI, arsitektur ini meningkatkan pemanfaatan GPU dan efisiensi operasional, mendukung transisi industri dari pelatihan batch dan penyewaan GPU ke layanan inferensi persisten dan AI agentik.
Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Direktur Strategi Global
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Situs Web: www.qianxingdata.com/www.storagesserver.com
Fokus Bisnis:
Distribusi Produk ICT/Integrasi & Layanan Sistem/Solusi Infrastruktur
Dengan pengalaman distribusi TI lebih dari 20 tahun, kami bermitra dengan merek global terkemuka untuk memberikan produk yang andal dan layanan profesional.
Menggunakan Teknologi untuk Membangun Dunia yang Cerdas”Penyedia Layanan Produk ICT Tepercaya Anda!
Sandy Yang/Direktur Strategi Global
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Situs Web: www.qianxingdata.com/www.storagesserver.com
Fokus Bisnis:
Distribusi Produk ICT/Integrasi & Layanan Sistem/Solusi Infrastruktur
Dengan pengalaman distribusi TI lebih dari 20 tahun, kami bermitra dengan merek global terkemuka untuk memberikan produk yang andal dan layanan profesional.
Menggunakan Teknologi untuk Membangun Dunia yang Cerdas”Penyedia Layanan Produk ICT Tepercaya Anda!



