NVIDIA Vera Rubin Tăng Tốc Cuộc Đua Hạ Tầng AI Với Hiệu Suất Trên Mỗi Megawatt Gấp 10 Lần
NVIDIA tiếp tục củng cố vị thế trung tâm trong chuỗi hạ tầng AI toàn cầu khi nền tảng Vera Rubin NVL72 được đưa vào sản xuất và cho thấy mức cải thiện lớn về hiệu suất năng lượng. Trong bối cảnh các trung tâm dữ liệu AI ngày càng bị giới hạn bởi điện năng, làm mát và chi phí token, thông lượng trên mỗi megawatt đang trở thành thước đo quan trọng không kém sức mạnh tính toán thô.
Bối cảnh thị trường
NVIDIA cho biết nền tảng Vera Rubin đang được đưa vào sản xuất quy mô lớn để phục vụ các “AI factory” thế hệ mới. Theo thông báo của công ty, hàng trăm đối tác trong hệ sinh thái chuỗi cung ứng, bao gồm 150 đối tác tại Đài Loan, đang tăng tốc sản xuất hệ thống Vera Rubin trên hơn 350 nhà máy tại 30 quốc gia.
Điểm nổi bật của nền tảng này là hiệu suất năng lượng. CoreWeave, một trong những nhà cung cấp cloud AI lớn, cho biết họ đã chạy benchmark DeepSeek-R1 trên Vera Rubin NVL72 và ghi nhận mức thông lượng token trên mỗi megawatt cao hơn 10 lần so với NVIDIA GB200 NVL72 ở cùng mục tiêu tương tác. Đây là dữ liệu quan trọng vì các mô hình reasoning và agentic AI thường tạo ra nhiều token hơn, cần nhiều bước suy luận hơn và tiêu thụ nhiều tài nguyên hơn các tác vụ AI truyền thống.
Vera Rubin NVL72 kết hợp 72 GPU Rubin và 36 CPU Vera trong một hệ thống quy mô giá đỡ, sử dụng NVLink thế hệ thứ sáu với băng thông all-to-all 260 TB/s. NVIDIA mô tả hệ thống này như một nền tảng được thiết kế cho các workload agentic AI, nơi mô hình không chỉ trả lời một lần mà còn lập kế hoạch, gọi công cụ, kiểm tra lại và suy luận qua nhiều bước.
Các đối tác cloud lớn cũng đang tham gia triển khai. NVIDIA cho biết Google Cloud đã chạy phiên bản A5X đầu tiên dựa trên Vera Rubin NVL72 cho startup Ineffable Intelligence tại London, trong khi Microsoft và Mistral đang mở rộng hạ tầng AI tại châu Âu với nền tảng này.
Tác động đến các nhóm tài sản
Đối với cổ phiếu NVIDIA, Vera Rubin là tín hiệu cho thấy công ty tiếp tục dịch chuyển từ vai trò nhà cung cấp GPU đơn lẻ sang nhà cung cấp hệ thống hạ tầng AI toàn diện. Giá trị không chỉ nằm ở GPU Rubin, mà còn ở CPU Vera, NVLink, Spectrum-X Ethernet, BlueField DPU, phần mềm TensorRT-LLM, Dynamo và toàn bộ kiến trúc rack-scale.
Điều này có thể củng cố biên lợi nhuận và vị thế cạnh tranh của NVIDIA nếu khách hàng cloud tiếp tục ưu tiên mua hệ thống trọn gói thay vì chỉ mua chip riêng lẻ. Khi AI chuyển từ giai đoạn thử nghiệm sang triển khai quy mô lớn, các doanh nghiệp không chỉ quan tâm đến tốc độ huấn luyện, mà còn tập trung mạnh hơn vào chi phí suy luận, chi phí token, hiệu suất điện năng và độ ổn định vận hành.
Đối với CoreWeave, việc là một trong những đơn vị đầu tiên validate Vera Rubin NVL72 trên phần cứng thực tế giúp công ty củng cố vị thế trong thị trường cloud AI chuyên dụng. Nếu hiệu suất 10 lần token trên mỗi megawatt được phản ánh trong vận hành thực tế, CoreWeave có thể cải thiện chi phí phục vụ mô hình reasoning, mở rộng khách hàng doanh nghiệp và cạnh tranh tốt hơn với các cloud lớn.
Đối với Microsoft Azure, Google Cloud và Oracle Cloud Infrastructure, Vera Rubin là một phần của cuộc đua xây dựng năng lực AI quy mô lớn. Các cloud provider đang cạnh tranh không chỉ bằng số lượng GPU, mà còn bằng hiệu quả chi phí, khả năng cung cấp điện toán cho mô hình lớn, độ trễ, bảo mật và năng lực triển khai khu vực.
Đối với các nhà cung cấp hạ tầng điện, làm mát và trung tâm dữ liệu, Vera Rubin nhấn mạnh rằng điện năng đã trở thành nút thắt chiến lược của AI. Nếu mỗi megawatt tạo ra nhiều token hơn, các data center có thể phục vụ nhiều workload hơn trong cùng giới hạn điện. Điều này có thể giảm áp lực ngắn hạn về năng lượng, nhưng đồng thời cũng kích thích nhu cầu xây dựng thêm AI factory khi chi phí đơn vị giảm.
Đối với nhóm bán dẫn rộng hơn, nền tảng Vera Rubin tạo thêm áp lực cạnh tranh lên AMD, Intel và các nhà thiết kế accelerator khác. Cuộc đua không còn chỉ là số FLOPS hay dung lượng bộ nhớ, mà là khả năng tối ưu toàn hệ thống: GPU, CPU, networking, cooling, phần mềm và vận hành ở quy mô cụm.


