Bitget App
Giao dịch thông minh hơn
Mua CryptoThị trườngGiao dịchFutures‌EarnAIQuảng trườngThêm
Guo Mingqi: Nvidia khởi động lại dự án chip tối ưu hóa tiền xử lý suy luận Rubin CPX

Guo Mingqi: Nvidia khởi động lại dự án chip tối ưu hóa tiền xử lý suy luận Rubin CPX

华尔街见闻华尔街见闻2026/09/01 11:01
Hiển thị bản gốc
Theo:华尔街见闻

Cuộc khảo sát của nhà phân tích nổi tiếng Kuo Ming-Chi cho thấy Nvidia đã khởi động lại chip AI suy luận dự đoán trước “Rubin CPX”, dự kiến sẽ bắt đầu sản xuất hàng loạt vào đầu năm 2027. Phiên bản mới sử dụng bộ nhớ HBM4 168GB, công suất tiêu thụ 2300 watt, hiệu năng gần bằng GPU Rubin tiêu chuẩn. Chip này áp dụng thiết kế mô-đun độc lập và kết nối phân tầng, phối hợp triển khai theo tỷ lệ 1:1 với Rubin GPU, chuyên dùng cho dự đoán trước và tạo KV Cache, nhằm giảm chi phí suy luận ngữ cảnh dài.

Nvidia lặng lẽ khởi động lại một dự án chip từng được thị trường cho là đã bị từ bỏ, với mục tiêu tập trung vào giai đoạn prefill (điền trước) của AI inference – vốn có chi phí cao.

Theo khảo sát mới nhất từ nhà phân tích nổi tiếng Ming-Chi Kuo, Nvidia đã tái khởi động dự án GPU tăng tốc prefill inference AI “Rubin CPX” và tiến hành điều chỉnh lớn về thiết kế sản phẩm. Theo kế hoạch hiện tại, phiên bản mới của Rubin CPX dự kiến sẽ được sản xuất vào quý 1 năm 2027.

Việc tái khởi động dự án lần này phát đi một tín hiệu rõ ràng: Nvidia đang tăng cường giải quyết những điểm nghẽn về hiệu năng và chi phí ở giai đoạn prefill của AI inference. Khi độ dài ngữ cảnh của mô hình lớn tăng lên, giai đoạn prefill phải xử lý lượng lớn thông tin đầu vào và tạo KV Cache, hiệu suất của nó sẽ ảnh hưởng trực tiếp đến tổng chi phí inference AI và tính kinh tế khi triển khai.

Ming-Chi Kuo cho biết, hiện nay hơn 50% khối lượng công việc inference AI xuất phát từ xử lý ngữ cảnh đầu vào và khởi tạo KV Cache.

Thông số chip được điều chỉnh lớn, hiệu năng gần tiệm cận Rubin tiêu chuẩn

Các thông số lõi của Rubin CPX mới đã thay đổi rõ rệt so với phương án trước đây.

Về hiệu năng và mức tiêu thụ điện năng, phiên bản mới của CPX gần như đạt đến hiệu suất của Rubin GPU tiêu chuẩn, với mức tiêu thụ điện tối đa mỗi card cũng đạt 2300W. Ở bộ nhớ, Rubin CPX mới sử dụng 168GB HBM4, nâng cấp đáng kể so với 128GB GDDR7 trước đó nhưng vẫn thấp hơn mức 288GB HBM4 trên Rubin GPU tiêu chuẩn.

Theo Ming-Chi Kuo, tổng dung lượng HBM4 của khay tính toán 8 card CPX vào khoảng 1,34TB, đáp ứng phần lớn các khối lượng công việc prefill ngữ cảnh dài và yêu cầu về KV Cache. Điều này có nghĩa là Rubin CPX không đơn thuần chỉ nâng cao hiệu năng tính toán toàn diện, mà được thiết kế lại tập trung vào dung lượng bộ nhớ lớn và tối ưu hiệu năng prefill cho những trường hợp sử dụng ngữ cảnh dài.

Chuyển từ giá đỡ dùng chung sang triển khai độc lập, cấu hình linh hoạt hơn

Kiến trúc giá đỡ cũng là điểm nhấn trong đợt điều chỉnh này.

Ở phương án cũ, CPX dự kiến chia sẻ giá đỡ cùng với Rubin GPU; phiên bản mới sẽ áp dụng giá đỡ MGX ETL độc lập, cho phép khách hàng mở rộng riêng biệt hiệu năng tính toán CPX theo nhu cầu thực tế.

Cụ thể, khách hàng có thể lựa chọn quy mô triển khai 64, 128, 192 hoặc 256 GPU CPX. Mỗi 64 GPU CPX hình thành một mô-đun giá đỡ, bao gồm 8 khay tính toán (mỗi khay gắn 8 GPU CPX), kèm một khay switch trao đổi dữ liệu.

Thiết kế dạng mô-đun đồng nghĩa khách hàng không cần mua nguyên giá đỡ Rubin quy mô lớn, mà có thể linh hoạt bổ sung hiệu năng CPX phù hợp với tải prefill thực tế.

Thiết kế liên kết phân tầng, giảm chi phí triển khai prefill

Về kiến trúc liên kết, Rubin CPX áp dụng thiết kế phân tầng, cân bằng giữa hiệu năng và chi phí.

Bên trong một khay tính toán, 8 GPU CPX được nâng cấp (Scale-up) qua NVLink. Băng thông NVLink của mỗi GPU CPX từ 1-1,5TB/s, thấp hơn mức 3,6TB/s của Rubin GPU tiêu chuẩn.

Ở tầng Scale-out giữa các khay và trong cụm mô-đun giá đỡ, CPX sử dụng kết nối Spectrum-6 Ethernet dây đồng L1; liên kết giữa các mô-đun giá đỡ sẽ qua switch Spectrum-6 trên mỗi mô-đun, kết nối bởi đường truyền cáp quang OSFP.

So với các phương án phụ thuộc hoàn toàn vào liên kết GPU băng thông cao, kiến trúc phân tầng này nhấn mạnh tối ưu chi phí cho các tình huống prefill.

Phối hợp cùng Rubin GPU, nhắm vào inference ngữ cảnh dài

Rubin CPX không phải là GPU đa năng chạy độc lập, mà đóng vai trò tăng tốc prefill và đi kèm với Vera Rubin NVL72.

Theo Ming-Chi Kuo, Nvidia khuyến nghị triển khai CPX và Rubin GPU theo tỷ lệ 1:1: CPX phụ trách tính toán giai đoạn prefill và tạo KV Cache, sau đó truyền KV Cache cho Rubin GPU qua mạng RDMA Ethernet để giải mã tiếp theo.

Về định vị sản phẩm, Rubin CPX không phải thay thế Rubin GPU tiêu chuẩn, mà là giúp quá trình AI inference được phân tách hơn, các GPU khác nhau đảm nhận tác vụ prefill và decoding riêng biệt.

Ming-Chi Kuo đánh giá đây là "giải pháp tối ưu nhất về chi phí-hiệu năng cho prefill ngữ cảnh dài". Khi cửa sổ ngữ cảnh của mô hình AI tiếp tục được mở rộng, tính toán và quy mô KV Cache của prefill ngày càng tăng, việc Nvidia tái khởi động dự án CPX lần này chính là nỗ lực giảm chi phí inference ngữ cảnh dài thông qua phần cứng chuyên dụng và phương thức triển khai dị thể.

0
0

Tuyên bố miễn trừ trách nhiệm: Mọi thông tin trong bài viết đều thể hiện quan điểm của tác giả và không liên quan đến nền tảng. Bài viết này không nhằm mục đích tham khảo để đưa ra quyết định đầu tư.

PoolX: Khóa để nhận token mới.
APR lên đến 12%. Luôn hoạt động, luôn nhận airdrop.
Khóa ngay!