logo
Rumah Kasus

Data VAST dan AMD Klaim 9x Lebih Cepat Waktu-ke-Token Pertama Dengan KV Cache Offload pada Instinct

Sertifikasi
Cina Beijing Qianxing Jietong Technology Co., Ltd. Sertifikasi
Cina Beijing Qianxing Jietong Technology Co., Ltd. Sertifikasi
Ulasan pelanggan
Staf penjualan Beijing Qianxing Jietong Technology Co, Ltd sangat profesional dan sabar. Mereka dapat memberikan kutipan dengan cepat. Kualitas dan kemasan produk juga sangat baik. Kerjasama kami sangat lancar.

—— Festfing DV》LLC

Ketika saya sangat mencari CPU intel dan SSD Toshiba, Sandy dari Beijing Qianxing Jietong Technology Co., Ltd memberi saya banyak bantuan dan mendapatkan produk yang saya butuhkan dengan cepat. Saya sangat menghargai dia.

—— Kitty Yen

Sandy dari Beijing Qianxing Jietong Technology Co, Ltd adalah penjual yang sangat berhati-hati, yang dapat mengingatkan saya tentang kesalahan konfigurasi saat saya membeli server. Para insinyur juga sangat profesional dan dapat dengan cepat menyelesaikan proses pengujian.

—— Strelkin Mikhail Vladimirovich

Kami sangat senang dengan pengalaman kami bekerja dengan Beijing Qianxing Jietong. Kualitas produk sangat baik, dan pengiriman selalu tepat waktu. Tim penjualan mereka profesional, sabar, dan sangat membantu dengan semua pertanyaan kami. Kami sangat menghargai dukungan mereka dan berharap dapat menjalin kemitraan jangka panjang. Sangat direkomendasikan!

—— Ahmad Navid

Kualitas: Pengalaman yang baik dengan pemasok saya. MikroTik RB3011 sudah digunakan, tetapi dalam kondisi yang sangat baik dan semuanya bekerja dengan sempurna. Komunikasi cepat dan lancar,dan semua kekhawatiran saya segera ditangani. Penyedia yang sangat dapat diandalkan sangat direkomendasikan.

—— Geran Colesio

I 'm Online Chat Now

Data VAST dan AMD Klaim 9x Lebih Cepat Waktu-ke-Token Pertama Dengan KV Cache Offload pada Instinct

July 28, 2026
VAST Data telah memperluas kemitraannya dengan AMD untuk memajukan infrastruktur AI untuk platform cloud dan perusahaan yang menjalankan pelatihan model, inferensi, generasi yang ditingkatkan pengambilan (RAG), dan beban kerja AI agentik. Tumpukan terintegrasi menyatukan VAST AI Operating System dengan prosesor AMD EPYC Generasi ke-6, GPU AMD Instinct, perangkat keras jaringan AMD, dan perangkat lunak ROCm.

Kolaborasi ini selaras dengan pergeseran industri besar: infrastruktur AI berevolusi melampaui kluster pelatihan saja untuk mendukung konteks persisten, inferensi konkurensi tinggi, dan alur kerja agen multi-putaran. Penerapan AI modern memprioritaskan pergerakan data yang efisien, manajemen cache KV yang dioptimalkan, pemanfaatan GPU yang lebih tinggi, dan akses latensi rendah ke model besar dan kumpulan data kontekstual.

Arsitektur Disaggregated Shared Everything (DASE) VAST berfungsi sebagai lapisan data bersama terpadu untuk lingkungan AI modern ini. Ini mengkonsolidasikan penyimpanan file dan objek, database, streaming peristiwa, dan layanan data inti di bawah satu namespace global, sambil memberikan multi-tenancy dan isolasi beban kerja untuk cloud AI yang menjalankan tugas pelanggan dan aplikasi bersamaan yang beragam.

AMD EPYC 9006 Memberdayakan Perangkat Keras VAST Generasi Berikutnya

VAST mengadopsi prosesor AMD EPYC 9006-seri Generasi ke-6 (Venice) untuk sistem CBox Generasi ke-6 dan EBox Generasi ke-3 mendatang, yang membentuk fondasi perangkat keras VAST AI Operating System. Platform EPYC 9006 memperkenalkan konektivitas PCIe Gen6 ke jajaran perangkat keras VAST, menggandakan bandwidth I/O per generasi.

kasus perusahaan terbaru tentang Data VAST dan AMD Klaim 9x Lebih Cepat Waktu-ke-Token Pertama Dengan KV Cache Offload pada Instinct  0

Peningkatan ini meningkatkan throughput penyimpanan file dan objek serta menurunkan latensi untuk beban kerja database, data warehouse, dan streaming peristiwa yang didukung oleh VAST DataBase dan DataEngine. Untuk infrastruktur AI, bandwidth I/O yang ditingkatkan mengurangi hambatan di seluruh komputasi, jaringan, dan penyimpanan NVMe, menguntungkan pemuatan model, pipeline pengambilan, akses checkpoint, dan alur kerja cache KV eksternal yang melebihi batas memori GPU asli.

Arsitektur Referensi Tri-Player dengan AMD dan DriveNets

VAST, AMD, dan DriveNets bersama-sama membangun arsitektur referensi infrastruktur AI terpadu, menggabungkan infrastruktur AI Helios skala rak AMD, VAST AI OS, dan jaringan DriveNets AI Fabric. Kerangka kerja ini memberikan panduan penerapan standar untuk pelatihan AI, inferensi, pembelajaran penguatan, dan beban kerja cache KV, menyediakan praktik terbaik ukuran dan ketersediaan bagi perusahaan yang membangun pabrik AI dengan infrastruktur data bersama dan jaringan berkinerja tinggi.

VAST juga telah memperluas hubungan ekosistemnya dengan vendor inferensi TensorMesh dan EmbeddedLLM, berfokus pada arsitektur inferensi tingkat produksi untuk kasus penggunaan AI agentik, dengan detail integrasi dan peluncuran spesifik yang belum diungkapkan.

Offload Cache KV yang Dioptimalkan untuk Inferensi Konkurensi Tinggi

Inti dari kolaborasi yang diperbarui adalah offload cache KV yang ditingkatkan, memanfaatkan GPU AMD Instinct, AMD Infinity Context, perangkat lunak ROCm, dan VAST AI OS. Cache KV menyimpan data status perhatian yang dihasilkan inferensi untuk mempercepat interaksi multi-putaran dan beban kerja AI konteks panjang, namun ukuran cache yang besar dengan cepat mengonsumsi memori GPU yang terbatas.

kasus perusahaan terbaru tentang Data VAST dan AMD Klaim 9x Lebih Cepat Waktu-ke-Token Pertama Dengan KV Cache Offload pada Instinct  1

Offloading atau tiering cache KV ke penyimpanan bersama berkinerja tinggi membebaskan memori GPU untuk tugas aktif sambil mempertahankan data kontekstual untuk permintaan inferensi berikutnya. Pengujian awal pada GPU AMD Instinct MI355X memberikan waktu-ke-token-pertama 9x lebih cepat dan throughput token 9,7x lebih tinggi untuk beban kerja AI agentik konkurensi tinggi melalui offload cache KV yang didukung VAST, dengan kinerja bervariasi berdasarkan basis perangkat keras, beban kerja, dan konfigurasi penyimpanan.

Selain itu, kebijakan siklus hidup otomatis VAST berlaku untuk data cache KV, memungkinkan kedaluwarsa dan penghapusan konten yang di-cache sesuai jadwal — fitur penting untuk menangani data inferensi yang sensitif, pribadi, atau diatur.

Interkoneksi Penyimpanan GPU Berkecepatan Tinggi melalui Pensando Pollara 400

Arsitektur ini menerapkan NIC AI AMD Pensando Pollara 400 untuk menghubungkan GPU AMD Instinct ke kluster penyimpanan VAST. Mendukung NFS melalui TCP dan RDMA, NIC memungkinkan transfer data GPU-ke-penyimpanan yang efisien, memberikan akses latensi rendah ke penyimpanan VAST berbasis NVMe untuk cache KV dan beban kerja inferensi umum.

Desain ini memisahkan penskalaan manajemen konteks dari batas memori GPU fisik. Alih-alih memperlakukan penyimpanan sebagai persistensi pasif, VAST memposisikan platformnya sebagai lapisan data dan eksekusi terpadu untuk manajemen model terdistribusi, database, streaming, aset file, dan konteks AI. Untuk penyedia cloud AI, arsitektur ini meningkatkan pemanfaatan GPU dan efisiensi operasional, mendukung transisi industri dari pelatihan batch dan penyewaan GPU ke layanan inferensi persisten dan AI agentik.

Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Direktur Strategi Global
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Situs Web: www.qianxingdata.com/www.storagesserver.com
Fokus Bisnis:
Distribusi Produk ICT/Integrasi & Layanan Sistem/Solusi Infrastruktur
Dengan pengalaman distribusi TI lebih dari 20 tahun, kami bermitra dengan merek global terkemuka untuk memberikan produk yang andal dan layanan profesional.
Menggunakan Teknologi untuk Membangun Dunia yang Cerdas”Penyedia Layanan Produk ICT Tepercaya Anda!
Rincian kontak
Beijing Qianxing Jietong Technology Co., Ltd.

Kontak Person: Ms. Sandy Yang

Tel: 13426366826

Mengirimkan permintaan Anda secara langsung kepada kami (0 / 3000)