Tin tức

CUDA Sắp Có Mặt Trên RISC-V, Nhưng Chỉ Dành Cho Silicon Cấp Máy Chủ

Nvidia muốn đưa CUDA lên RISC-V, nhưng yêu cầu rất khắt khe: RVA23, ACPI, PCIe coherency, và hơn thế nữa. Hầu hết các bo mạch RISC-V hiện có không đáp ứng được.

August 24, 2026· 5 min read
CUDA Sắp Có Mặt Trên RISC-V, Nhưng Chỉ Dành Cho Silicon Cấp Máy Chủ

Tại Hot Chips 2026, Nvidia đã vạch ra kế hoạch đưa CUDA lên CPU RISC-V. Động thái này có ý nghĩa quan trọng: CUDA đã bị khóa chặt với x86-64 và aarch64 trong nhiều năm, và RISC-V đang gõ cửa thị trường máy chủ mà không có hệ sinh thái phần mềm hỗ trợ. Tuy nhiên, các yêu cầu của Nvidia cho thấy rõ ràng đây không phải là chuyện dành cho các bo mạch của người đam mê. Họ muốn silicon cấp máy chủ, và họ muốn nó đáp ứng một bộ tiêu chuẩn cụ thể.

Đầu tiên, Nvidia yêu cầu CPU RVA23, cùng với việc tuân thủ các thông số kỹ thuật của SoC máy chủ và nền tảng máy chủ RISC-V. Các thông số này bao gồm các tính năng RAS, bộ xử lý bảo mật và các kỳ vọng doanh nghiệp cơ bản khác. Riêng điều đó đã loại bỏ hầu hết phần cứng RISC-V đang được bán ra hiện nay.

Ngoài cấu hình, Nvidia muốn một vài thứ không được đảm bảo bởi các thông số kỹ thuật. Phần mở rộng vector là một ví dụ: Nvidia muốn hỗ trợ predication để tránh các nhánh rẽ trong kernel CUDA. Họ hoàn toàn không muốn tình huống mẫu số chung thấp nhất, nơi họ không thể sử dụng các phần mở rộng tăng hiệu suất vì một số phần cứng có thể không có chúng. Điều đó sẽ buộc họ phải phát hành mã kém hiệu quả.

ACPI là một điểm vướng mắc khác. Nhóm phần mềm của Nvidia không hài lòng khi bắt đầu chuyển CUDA vì RISC-V thiếu ACPI. Điều đó đã được giải quyết: diễn đàn UEFI đã thêm hỗ trợ ACPI cho RISC-V vào năm 2025, và thông số kỹ thuật BRS của RISC-V bao gồm nó. Nhưng việc áp dụng sẽ mất thời gian, như thế giới aarch64 đã cho thấy—hỗ trợ ACPI ở đó vẫn chưa đồng đều dù đã có trong các tiêu chuẩn nhiều năm.

Sau đó là PCIe coherency. Nvidia muốn một sự đảm bảo, không phải một khuyến nghị. Nếu không có nó, các engine DMA có thể đọc dữ liệu cũ từ DRAM trong khi dữ liệu đã sửa đổi nằm trong bộ nhớ cache của CPU, và CPU có thể đọc dữ liệu cũ sau khi DMA ghi. Phần mềm sẽ phải vô hiệu hóa cache một cách tường minh, điều này là một cơn ác mộng để đưa vào ngăn xếp CUDA. Nvidia coi coherency là một tính năng tiêu chuẩn của CPU máy chủ, và thông số kỹ thuật SoC máy chủ RISC-V chỉ khuyến nghị nó. Nvidia muốn nó trở thành bắt buộc.

Giao tiếp PCIe peer-to-peer cũng được yêu cầu. Nếu không có nó, các bộ đệm được sao chép giữa hai thiết bị phải đi qua bộ nhớ CPU, gây tốn hiệu suất và thêm độ phức tạp đồng bộ hóa.

Nvidia đã không trình bày chi tiết từng yêu cầu—họ lưu ý rằng danh sách đầy đủ nằm gọn trong hai trang. Nhưng ý chính rất rõ ràng: đây là lãnh thổ cấp doanh nghiệp.

Nvidia cũng đề cập đến NVLink Fusion, cho phép các công ty khác triển khai IP NVLink của Nvidia trên chip của họ. Đây là cách GB10 kết nối die CPU của Mediatek với GPU Nvidia qua NVLink C2C. NVLink Fusion sẽ cho phép khách hàng kết nối CPU tùy chỉnh—có thể là CPU RISC-V—với GPU Nvidia bằng NVLink. Các yêu cầu bao gồm mọi thứ từ CUDA cộng với hỗ trợ cho các framework như DOCA và NCCL, và mối quan hệ hợp tác chặt chẽ với Nvidia. Điều đó là hiển nhiên, với độ phức tạp của việc tích hợp IP.

Điều Này Có Nghĩa Gì Cho RISC-V

Hệ sinh thái phần mềm RISC-V còn một chặng đường dài trước khi bắt kịp x86-64 và aarch64. Việc chuyển CUDA của Nvidia là một bước đi đầy hứa hẹn, nhưng nó sẽ không làm cho mọi bo mạch RISC-V sẵn sàng cho GPU. Hầu hết phần cứng hiện có không đáp ứng các yêu cầu. Riêng ACPI đã là một rào cản sẽ mất nhiều năm để vượt qua, nếu kinh nghiệm aarch64 là một chỉ dẫn.

Khi các hệ thống RISC-V hỗ trợ CUDA xuất hiện, chúng sẽ là máy chủ, không phải các máy tính bo mạch đơn mà những người đam mê hay mày mò. Nvidia đang hợp tác với SiFive, và SiFive có kế hoạch trình diễn một hệ thống chạy CUDA tại Hot Chips. Thông số CPU ví dụ trên slide của Nvidia gợi ý một chip máy chủ có số lõi cao.

Hy vọng là Nvidia sẽ không khóa CUDA khỏi các hệ thống không được hỗ trợ. Những người đam mê rất muốn cấp nguồn cho GPU Nvidia từ các bo mạch RISC-V, ngay cả khi điều đó có nghĩa là các đường chậm hơn cho một số thao tác. Các nhánh rẽ thay vì predication có thể hoạt động nếu chúng có thể dự đoán được. Việc vô hiệu hóa cache gây tốn hiệu suất, nhưng điều đó có thể chấp nhận được cho các khối lượng công việc nặng về tính toán. Các yêu cầu của Nvidia có thể chỉ là vì sự thuận tiện—một bản chuyển nhanh, ít rủi ro—chứ không phải là một giới hạn vĩnh viễn. Thời gian sẽ trả lời.

Nvidia muốn một sự đảm bảo, không phải một khuyến nghị, khi nói đến PCIe coherency—nếu không có nó, các engine DMA có thể đọc dữ liệu cũ và ngăn xếp CUDA trở thành cơn ác mộng vô hiệu hóa cache.
Ban biên tập Manul X