AMD GFX1250: LLVM Commits tiết lộ chi tiết kiến trúc MI455X
Các commit LLVM tiết lộ về bộ tăng tốc MI455X sắp ra mắt của AMD: bộ nhớ đệm LDS/L0 hợp nhất, 1024 VGPR mỗi wave, chỉ hỗ trợ Wave32, và các tensor ops được nâng cấp.

Bộ tăng tốc trung tâm dữ liệu thế hệ tiếp theo của AMD, MI455X (mã hiệu GFX1250), đang nhận được hỗ trợ sơ bộ trong LLVM, và các commit vẽ nên một bức tranh rõ ràng về một quái vật tính toán đã loại bỏ mọi dấu vết đồ họa. Con chip này sẽ cung cấp sức mạnh cho rack Helios và dự kiến sẽ được công bố tại sự kiện Advancing AI của AMD.
Phân tích chuyên sâu về kiến trúc
GFX1250 chỉ hỗ trợ Wave32 — một sự khác biệt so với thiết kế chỉ Wave64 của CDNA và khả năng chế độ kép của RDNA. Điều này có nghĩa là các kernel CDNA hiện tại sẽ cần được đánh giá lại. Mỗi SIMD hiện có thể định địa chỉ lên tới 1024 VGPR, một bước nhảy vọt so với phân bổ 256+256 riêng biệt của CDNA4 và giới hạn 256 thanh ghi của RDNA. Đây là một lợi thế cho các khối lượng công việc ML có áp lực thanh ghi cao.
Thay đổi đáng kể nhất là sự hợp nhất của bộ nhớ đệm LDS và vector L0 thành một bộ nhớ đệm WGP (WGP$) 448KB duy nhất, phù hợp với những gì Nvidia và Intel đã làm trong nhiều năm. AMD là hãng cuối cùng còn giữ cấu trúc phân tách. LDS tối đa có thể định địa chỉ mỗi wavefront tăng gấp đôi lên 320kB, và LDS thực tế có thể lớn hơn nhờ vào pool hợp nhất.
Phân bổ VGPR động, một tính năng nổi bật của RDNA4, lại vắng mặt đáng chú ý — lệnh này là no-op. Điều này gây ngạc nhiên vì nhu cầu thanh ghi cao của các khối lượng công việc ML. Các phép toán FP32 đóng gói (hai phép FP32 mỗi lane) được kế thừa từ CDNA2, hiệu quả tăng gấp đôi độ rộng vector so với RDNA.
Chỉ tính toán, không đồ họa
GFX1250 loại bỏ gần như toàn bộ phần cứng đồ họa: không có rasterizer, không có lệnh texture, không có BVH (dò tia), không có nội suy đỉnh, và — không giống như CDNA trước đây — không có lệnh buffer có kiểu hoặc không kiểu. Đây là một bộ tăng tốc tính toán thuần túy, tiết kiệm diện tích chip cho những gì thực sự quan trọng.
Tensor Operations: Tinh hoa của cả hai thế giới
Các đơn vị tensor WMMA kết hợp mô hình lập trình đơn giản hơn của RDNA4 với hỗ trợ định dạng rộng hơn của CDNA4. Kích thước ma trận giữ nguyên M=N=16, với K thay đổi theo loại: K=4 cho FP64/FP32, K=32 cho FP16, K=64 cho INT8, K=128 cho FP8. INT4 giữ nguyên K=32 (mức RDNA4). GFX1250 hỗ trợ tất cả các kiểu dữ liệu từ cả CDNA4 và RDNA4 ngoại trừ FP64, được dành riêng cho GFX1251 (MI430X) hướng đến HPC. Tính năng mở rộng kiểu OCP MX được bao gồm.
Các lệnh chuyển vị ma trận con LDS mới bổ sung cho các tính năng của RDNA4, và WMMA thưa thớt giữ nguyên K (thực hiện ít công việc hơn mỗi lệnh so với dày đặc).
Nhìn chung, GFX1250 trông giống như một cỗ máy làm việc ML được tinh chỉnh cẩn thận. Bộ nhớ đệm hợp nhất và tệp thanh ghi khổng lồ sẽ giúp thu hẹp khoảng cách với Blackwell của Nvidia, mặc dù chúng ta sẽ cần các điểm chuẩn thực tế để biết chắc chắn.
Thảo luận
0 bình luận
Hãy là người đầu tiên thảo luận.