Di KTT RAISE di Paris, DDN memamerkan kolaborasi berkelanjutannya dengan Nebul, penyedia hybrid cloud kedaulatan Eropa, yang berfokus pada peningkatan efisiensi untuk penerapan inferensi AI skala besar. Diperkenalkan minggu lalu, inisiatif bersama ini menyatukan platform inferensi Nebul, arsitektur intelijen data Infinia DDN, dan komputasi terakselerasi NVIDIA untuk mengatasi hambatan utama AI produksi: biaya pergerakan data dan keterbatasan kinerja selama beban kerja inferensi.
DDN membingkai kolaborasi ini di sekitar metrik produksi kritis: utilisasi GPU, throughput token, biaya per token, dan latensi. Sementara pelatihan model membangun nilai aset AI, inferensi mendefinisikan pengembalian operasional dan komersialnya. Peningkatan adopsi AI agentik, retrieval-augmented generation (RAG), dan inferensi konkurensi tinggi berarti infrastruktur penyimpanan dan data secara langsung memengaruhi efisiensi akselerator dan kecepatan respons AI.
Proyek bukti konsep aktif ini telah menghasilkan hasil awal yang menjanjikan. Para mitra telah mencatat peningkatan terukur dalam waktu ke token pertama dengan KV cache diaktifkan dan menyelesaikan validasi untuk infrastruktur berbasis RoCE. Pengujian berkelanjutan mencakup panjang urutan inferensi yang lebih lama, membuka potensi optimasi lebih lanjut untuk platform Infinia. Kolaborasi ini juga meluas ke upaya bersama NVIDIA pada kerangka kerja pengujian, verifikasi skalabilitas, dan publikasi teknis mendatang.
Platform terintegrasi memanfaatkan layanan KV cache terdistribusi, pergerakan data native GPU, orkestrasi data cerdas, dan arsitektur penyimpanan berkinerja tinggi. Akselerasi KV cache memberikan peningkatan inferensi yang signifikan dengan mempertahankan dan mengambil status perhatian yang telah dihitung sebelumnya dengan cepat, mengurangi perhitungan berulang dan menghilangkan penundaan pengiriman data yang menyebabkan GPU menganggur.
Para pemimpin dari DDN, Nebul, dan NVIDIA menyoroti pergeseran industri besar: prioritas infrastruktur AI beralih dari penerapan GPU mentah ke efisiensi operasional, memaksimalkan pengembalian dari perangkat keras akselerator yang ada. CEO DDN Alex Bouzari dan CEO Nebul Arnold Juffer mencatat bahwa fokus masa lalu pada skala model yang lebih besar telah digantikan oleh optimasi ekonomi inferensi untuk membuat AI produksi layak secara komersial melalui biaya per token yang lebih rendah. VP Infrastruktur Cloud NVIDIA Rod Evans menambahkan bahwa beban kerja agentik skala besar sekarang mengukur keberhasilan infrastruktur berdasarkan utilisasi GPU dan latensi, daripada kekuatan komputasi semata.
DDN menekankan bahwa infrastruktur AI harus berevolusi melampaui fungsi penyimpanan dasar untuk secara aktif mendukung alur kerja eksekusi AI. Platform infrastruktur perusahaan saat ini memberdayakan lebih dari satu juta GPU di seluruh dunia, melayani hyperscaler, penyedia cloud, perusahaan, pemerintah, dan lembaga penelitian.
Tim infrastruktur AI modern sekarang memprioritaskan metrik produksi inti ini:
Utilisasi GPU: Mengukur aktivitas akselerator yang efektif selama inferensi, memaksimalkan nilai perangkat keras GPU kelas atas.
Biaya per token: Menghubungkan kinerja infrastruktur secara langsung dengan biaya operasional output model AI.
Token per watt: Mengevaluasi efisiensi energi output inferensi AI.
Waktu ke token pertama: Menentukan responsivitas aplikasi AI interaktif dan pengalaman pengguna.
Waktu ke produksi: Mengukur upaya operasional untuk memigrasikan layanan AI dari pengujian ke penerapan komersial yang dapat diskalakan.
Karena inferensi menjadi beban kerja AI yang dominan, pengiriman konteks yang di-cache dan data perusahaan ke GPU dengan latensi rendah dan stabil akan sangat penting untuk mempertahankan utilisasi GPU yang tinggi dan mengendalikan biaya operasional jangka panjang.
Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Direktur Strategi Global
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Situs Web: www.qianxingdata.com/www.storagesserver.com
Fokus Bisnis:
Distribusi Produk ICT/Integrasi Sistem & Layanan/Solusi Infrastruktur
Dengan pengalaman distribusi TI lebih dari 20 tahun, kami bermitra dengan merek global terkemuka untuk menghadirkan produk yang andal dan layanan profesional.
“Menggunakan Teknologi untuk Membangun Dunia yang Cerdas”Penyedia Layanan Produk ICT Tepercaya Anda!
Sandy Yang/Direktur Strategi Global
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Situs Web: www.qianxingdata.com/www.storagesserver.com
Fokus Bisnis:
Distribusi Produk ICT/Integrasi Sistem & Layanan/Solusi Infrastruktur
Dengan pengalaman distribusi TI lebih dari 20 tahun, kami bermitra dengan merek global terkemuka untuk menghadirkan produk yang andal dan layanan profesional.
“Menggunakan Teknologi untuk Membangun Dunia yang Cerdas”Penyedia Layanan Produk ICT Tepercaya Anda!



