AMDはAdvancing AI 2026(2026年10月8日)で、AMD Instinct MI455X(Helios)と現行世代MI355Xの推論性能比較を公開しました。DeepSeek-V4-Flashの1K/1Kオンライン推論では、90 tokens/s/userの条件で総スループット比が33.98倍に達しています。
AMD InstinctはAMDが開発するデータセンターのAI・高性能計算向けアクセラレーター製品群で、ROCmのライブラリや実行基盤と組み合わせて使います。記事はEdward Tian氏とJeremy Arnold氏が執筆しました。
何を測ったか
記事の測定は2種類です。1つは実運用を代表するDeepSeek-V4-Flashのエンドツーエンドのオンライン推論ベンチマーク、もう1つは計算・メモリ帯域・ネットワーキングを個別に切り出したマイクロベンチマークです。
比率の算出方法は次のとおりです。ユーザー当たりの出力速度(interactivity)の目標値ごとに、その目標を満たしながら各GPUが出せる最大の総スループットを求め、MI455XをMI355Xで割ります。目標が緩い条件では両GPUともスループット上限付近にあり、比率は小さくなります。目標が厳しくなるとMI355Xの曲線が先に落ち、MI455Xは大きな同時バッチを維持できるため、比率が拡大します。
DeepSeek-V4-Flashでの結果
DeepSeek-V4-Flashは総パラメータ284B、1トークン当たり13B活性のMoEモデルです。コンテキスト長は最大100万トークンで、エキスパート重みをFP4、その他の大部分のパラメータをFP8で保持しています。
| interactivity (tokens/s/user) | 1K/1K比 | 1K/8K比 |
|---|---|---|
| 20 | 2.47x | 2.79x |
| 30 | 3.70x | 4.39x |
| 40 | 7.44x | 5.30x |
| 50 | 12.66x | — |
| 60 | 14.79x | — |
| 70 | 17.06x | — |
| 80 | 30.46x | — |
| 90 | 33.98x | — |
1K/1Kは1,024トークン入力・1,024トークン出力、1K/8Kは1,024トークン入力・8,192トークン出力のワークロードです。AMDは代表値として、高interactivity(約90)で最大34倍、中(約70)で17倍、低(約30)で4倍を挙げています。
試験構成と注意点
- 推論スタック: 両GPUともAMDのATOMを使い、DeepSeek-V4-Flashを単一GPUで提供
- 比較単位: MI455X 1基対MI355X 1基。MI355Xは8基構成のシステムのうち1基のみを使用
- MI455X環境: プレリリースのHelios bringup platform
- 集計: 各マイクロベンチマークを5回実行し、中央値を報告
- 比較方式: 同一構成で比べるapples-to-applesと、GPUごとに個別チューニングするpeak-to-peakを、ベンチマークごとに使い分けています
- 図: スループットはMI355Xのピークに正規化しています
AMDは、これらの結果を特定時点のスナップショットと位置付けています。MI455Xのソフトウェア対応は成熟途中で、今後のROCmやフレームワークのリリース、ソフトウェアバージョン、ワークロード、システム構成によって数値は変わるとしています。

まだコメントはありません。