NVIDIAのVeraホワイトペーパー:優れたシリコン、曖昧なストーリー
NVIDIAのVeraホワイトペーパーは、確かに印象的なArmサーバーCPUを紹介しているが、その反x86マーケティングはSMTを誤って伝え、ベンチマークを誇張している。我々はエンジニアリングとスピンを切り分ける。

NVIDIAの45ページに及ぶVeraホワイトペーパーは、二つの文書の物語である。内部に記述されたハードウェアは確かに印象的だ——同社独自のOlympusコアを中心に構築された88コアのモノリシックダイで、各コアは10幅のArm v9.2設計であり、値予測、グラフプリフェッチャー、2MBのプライベートL2、共有164MBのラストレベルキャッシュを備える。8つのLPDDR5Xインターフェースは1.2TB/sのメモリ帯域幅を約束する。初期の独立テストでは、Veraは公開ベンチマークで我々が見た中で最速のArmサーバーCPUであることが示唆されている。
しかし、ホワイトペーパーはx86を藁人形として描くことに時間を費やしすぎている。従来のSMTは「タイムスライシング」として戯画化され、構成可能なNUMAトポロジーは避けられない迷路として提示され、未定義のパフォーマンスカウンター比率が因果関係の証明として宣伝されている。イライラするのは、Veraがこの助けを必要としていないことだ——ハードウェアはそれ自体で成り立っている。ストーリーを分解してみよう。
Olympus:真に手ごわいコア
Olympusコアは広く、攻撃的である。1サイクルあたり10命令をデコードし、1サイクルあたり2つの分岐を処理し、ニューラル分岐予測、値予測、メモリリネーミング、大きな命令ウィンドウ、6つの128ビットSVEパイプ、4つのロードパイプ、2つのストアパイプ、96KBのL1データキャッシュを含む。2MBのプライベートL2は約10サイクルでアクセス可能である。これらの88コアは、3.4TB/sのコヒーレンシファブリックと分散164MBのシステムレベルキャッシュの背後にある。
値予測は、よりユニークな追加機能の一つである。Appleがこれを使用していることが発見され、AMDがZen 1/2で実験したが、Olympusはそれをより広範に実装しているようだ——Appleのアプローチに近い。しかし、グラフプリフェッチャーは新しいものではない:IntelのData-Dependent PrefetcherとArray of Pointersプリフェッチャーは、同じプロデューサー・コンシューマーアイデアを、より制約された形で実装している。そして「ニューラル分岐予測」は2012年のAMDのPiledriverに遡り、後にTAGEで改良された。
メモリサブシステムも同様に強力だ:8つのSOCAMM2 LPDDR5Xモジュールは最大1.5TBの容量と1.2TB/sの帯域幅を提供し、NVIDIAはわずか約50Wの消費電力を主張している。これはトレードオフだ——従来のEPYC/Xeonプラットフォームは、より大容量で交換可能なDIMMを提供するが、ボード面積と電力で支払う。
SMTの藁人形
ホワイトペーパーの図5は、「従来のSMT(x86)」とNVIDIAの「空間的マルチスレッディング」を対比し、x86がパイプラインを通じてスレッドを交互に切り替える一方で、NVIDIAはリソースを分割するように描いている。これは誤解を招く。実際のSMT実装は、サイクルごとにスレッドを選択するか、スレッドに依存しない動作をすることでステージを共有し、両方のスレッドが同じサイクルで実行ユニットを使用できるようにする。NVIDIAが示唆するような静的分割は、一方のスレッドがストールしたときにスループットを無駄にすることがある。
NVIDIAはそのアプローチについて「決定性、分離、サービス品質」を強調している——明らかにパフォーマンスではない。QoSは彼らのターゲット市場にとって有効な優先事項かもしれないが、図はそれが実際には設計上の選択であるのに、パフォーマンスの勝利のように見せている。
ベンチマーク:強力だが、但し書き付き
Phoronixの初期テストでは、Veraの幾何平均が5GHzのEPYC 9575Fより10%上、Xeon 6980Pの1.55倍、Graceの1.63倍であり、公開テストで最も高性能なArmサーバーCPUとなった。しかし、NVIDIAは許可されたワークロード範囲を選択し、周波数/電力モニタリングを禁止し、システムはプレプロダクションで1日間のテストウィンドウだった。より広範なカバレッジは、本番ハードウェアを待たなければならない。
ハードウェアは本物だ。その周りのマーケティングは本物ではない。エンジニアは、物語ではなくアーキテクチャのためにホワイトペーパーを読むべきだ。
ホワイトペーパーの最も強い主張はハードウェアであり、最も弱い主張はその周りに巻かれたストーリーである。
| 指標 | Vera | EPYC 9575F | Xeon 6980P | Grace |
|---|---|---|---|---|
| 幾何平均パフォーマンス | 1.0x(ベースライン) | 0.91x | 0.65x | 0.61x |
| コア数 | 88 | 128 | 128 | 72 |
| メモリ帯域幅 | 1.2 TB/s | 約0.5 TB/s | 約0.5 TB/s | 約1 TB/s |