Guo Mingqi: Nvidia Rubin CPX loyihasi - inference prefill optimizatsiya chipini qayta ishga tushirdi
Mashhur tahlilchi Guo Mingqi ning tadqiqotiga ko‘ra, Nvidia AI taxminiy to‘ldirish chipi “Rubin CPX” ni qayta ishga tushirdi va 2027 yil boshida ommaviy ishlab chiqarish boshlanishi kutilmoqda. Yangi versiya 168GB HBM4 xotiraga ega, quvvati 2300 vattni tashkil etadi va hisoblash kuchi standart Rubin GPU ga yaqin. Ushbu chip mustaqil modulli stend va qatlamli bog‘lash dizayniga asoslangan hamda Rubin GPU bilan 1:1 uyg‘unlikda ishlaydi. U asosan taxminiy to‘ldirish va KV Cache yaratishga ixtisoslashgan bo‘lib, uzoq kontekstli taxmin qilish xarajatlarini kamaytiradi.
Nvidia bozorda allaqachon rad etilgan deb hisoblangan chip loyihasini jimgina qayta ishga tushirdi, maqsad esa AI inference bosqichida yuqori xarajatli prefill (oldindan to‘ldirish) jarayonini optimallashtirishdan iborat.
Mashhur tahlilchi Ming-Chi Kuo’ning so‘nggi sanoat tadqiqotlariga ko‘ra, Nvidia AI inference prefill akselerator GPU loyihasi “Rubin CPX”ni qayta ishga tushirdi va mahsulot dizaynini keskin qayta ko‘rib chiqdi. Hozirgi rejalarga ko‘ra, yangi Rubin CPX 2027 yil birinchi choragida ishlab chiqarila boshlaydi.
Loyihaning qayta ishga tushirilishi aniq signalni ifodalaydi: Nvidia AI inference bosqichida prefill unumdorligi va xarajat muammolarini bartaraf etishni kuchaytirmoqda. Katta modellarning kontekst uzunligi ortib borayotgani sababli, prefill bosqichi ko‘plab kirish ma’lumotlarini qayta ishlash va KV Cache yaratishni talab qiladi; uning samaradorligi AI inference umumiy xarajatlari va joriy etish iqtisodiyotiga bevosita ta’sir ko‘rsatadi.
Ming-Chi Kuo’ning so‘zlariga ko‘ra, hozirda AI inference ish yukining 50% dan ortig‘i kontekstni qayta ishlash va KV Cache qurilishidan kelib chiqadi.
Chip spetsifikatsiyasi sezilarli darajada o‘zgardi, hisoblash quvvati standart Rubin’ga yaqinlashdi
Yangi Rubin CPX’ning asosiy xususiyatlarida ilgari taklif qilingan variantga nisbatan sezilarli o‘zgarishlar mavjud.
Hisoblash quvvati va energiya darajasida, yangi CPX’ning ishlashi deyarli Rubin GPU standartiga yetgan, har bir kartaning maksimal quvvati ham 2300 vattga chiqdi. Xotira qismida yangi CPX 168GB HBM4 video xotirani ishlatadi, ilgari 128GB GDDR7 bo‘lganidan ancha yuqori, lekin standart Rubin GPU’dagi 288GB HBM4’dan past.
Ming-Chi Kuo’ning aytishicha, 8 ta CPX karta o‘rnatilgan hisoblash trayining umumiy HBM4 hajmi taxminan 1,34 TB bo‘lib, bu ko‘plab uzun kontekstli prefill ish yuklari va mos KV Cache talablari uchun yetarli. Bu shuni anglatadiki, Rubin CPX yuqori umumiy hisoblash quvvatiga intilmasdan, aynan uzun kontekstli holatlar uchun video xotira hajmi va prefill samaradorligini optimallashtirgan holda qaytadan ishlab chiqilgan.
Yaqindagi rack-sharing’dan mustaqil joriy etishga o‘tdi, konfiguratsiya yuqori moslashuvchan
Rack arxitekturasi ham bu galgi o‘zgarishning asosiy yo‘nalishlaridan biri bo‘ldi.
Avvalgi loyihada CPX va Rubin GPU bitta rack’da joylashishi ko‘zda tutilgan edi; yangi versiyada esa mustaqil MGX ETL rack’lari tanlangan va xaridorlar real ehtiyojlariga ko‘ra alohida CPX quvvatini kengaytirishlari mumkin.
Aniq qilib aytganda, foydalanuvchilar 64, 128, 192 yoki 256 ta CPX GPU’li massivlarni tanlashlari mumkin. Har 64 ta CPX GPU bitta rack modulini tashkil etadi, har bir modulda 8 ta hisoblash trayi bo‘ladi va har bir tray 8 ta CPX GPU, qo‘shimcha ravishda bitta switch tray bilan jihozlanadi.
Modullik dizayn shuni anglatadiki, xaridorlar endi yirik Rubin rack’larini majburiy sotib olishlari shart emas va ehtiyojga ko‘ra CPX quvvatini mos ravishda oshira oladilar.
Ko‘p qatlamli tarmoqlash dizayni, prefill joylashtirish xarajatini kamaytiradi
Tarmoqlash arxitekturasida, Rubin CPX ko‘p qatlamli dizaynni ishlatar ekan, unumdorlik va xarajatni optimal muvozanatlashtiradi.
Bitta hisoblash trayining ichida, 8 ta CPX GPU NVLink orqali Scale-up kengaytiriladi. Har bir CPX GPU uchun NVLink o‘tkazuvchanligi 1 dan 1.5 TB/s oralig‘ida, bu standard Rubin GPU’dagi 3.6TB/s’dan past.
Traylar yoki rack moduli ichidagi Scale-out bosqichida, CPX Spectrum-6 Ethernet to‘liq misli L1 ulanishdan foydalanadi; rack modullari o‘rtasida Spectrum-6 switch va OSFP tolali tarmoqlar orqali aloqa qilinadi.
Faqat yuqori o‘tkazuvchanlikdagi GPU tarmoqlashga bog‘liq echimlardan farqli ravishda, bu ko‘p qatlamli arxitektura aynan prefill ssenariylari uchun xarajatni optimallashtirishga urg‘u beradi.
Rubin GPU bilan hamkorlikda, uzun kontekstli inference’ga yo‘naltirilgan
Rubin CPX faqat mustaqil ishlaydigan universal GPU bo‘lib qolmasdan, prefill akseleratori sifatida Vera Rubin NVL72’ga juftlashtirilgan.
Ming-Chi Kuo’nig ta’kidlashicha, Nvidia CPX’ni Rubin GPU bilan 1:1 proporsiyada joylashtirishni tavsiya qiladi: CPX prefill bosqichida hisoblash va KV Cache yaratish uchun javobgar, so‘ngra KV Cache Ethernet RDMA orqali Rubin GPU’ga uzatiladi va Rubin GPU dekodlash jarayonini yakunlaydi.
Mahsulot pozitsiyasiga ko‘ra, Rubin CPX’ning asosiy vazifasi standart Rubin GPU o‘rnini bosish emas, balki AI inference jarayonini yanada segmentatsiya qilish, turli GPU’lar prefill va dekodlash ishlarini bo‘lib olishini ta’minlashdir.
Ming-Chi Kuo bu yechimni “uzun kontekstli prefill uchun eng yaxshi narx/samaradorlik kombinatsiyasi” sifatida tavsiflaydi. AI modellar kontekst oynasi kengayishda davom etar ekan, prefill hisoblash va KV Cache hajmi ham oshmoqda, Nvidia CPX loyihasini qayta ishga tushirishi aynan maxsus apparatura va geterogen joylashtirish orqali uzun kontekstli inference xarajatini yanada pasaytirishga intilayotganini ko‘rsatadi.
Mas'uliyatni rad etish: Ushbu maqolaning mazmuni faqat muallifning fikrini aks ettiradi va platformani hech qanday sifatda ifodalamaydi. Ushbu maqola investitsiya qarorlarini qabul qilish uchun ma'lumotnoma sifatida xizmat qilish uchun mo'ljallanmagan.
Sizga ham yoqishi mumkin




