AMD、MI455XはMI355X比で最大34倍の推論スループットと公表

AMDはAdvancing AI 2026(2026年10月8日)で、AMD Instinct MI455X(Helios)と現行世代MI355Xの推論性能比較を公開しました。DeepSeek-V4-Flashの1K/1Kオンライン推論では、90 tokens/s/userの条件で総スループット比が33.98倍に達しています。

AMD InstinctはAMDが開発するデータセンターのAI・高性能計算向けアクセラレーター製品群で、ROCmのライブラリや実行基盤と組み合わせて使います。記事はEdward Tian氏とJeremy Arnold氏が執筆しました。

何を測ったか

記事の測定は2種類です。1つは実運用を代表するDeepSeek-V4-Flashのエンドツーエンドのオンライン推論ベンチマーク、もう1つは計算・メモリ帯域・ネットワーキングを個別に切り出したマイクロベンチマークです。

比率の算出方法は次のとおりです。ユーザー当たりの出力速度(interactivity)の目標値ごとに、その目標を満たしながら各GPUが出せる最大の総スループットを求め、MI455XをMI355Xで割ります。目標が緩い条件では両GPUともスループット上限付近にあり、比率は小さくなります。目標が厳しくなるとMI355Xの曲線が先に落ち、MI455Xは大きな同時バッチを維持できるため、比率が拡大します。

DeepSeek-V4-Flashでの結果

DeepSeek-V4-Flashは総パラメータ284B、1トークン当たり13B活性のMoEモデルです。コンテキスト長は最大100万トークンで、エキスパート重みをFP4、その他の大部分のパラメータをFP8で保持しています。

interactivity (tokens/s/user) 1K/1K比 1K/8K比
20 2.47x 2.79x
30 3.70x 4.39x
40 7.44x 5.30x
50 12.66x —
60 14.79x —
70 17.06x —
80 30.46x —
90 33.98x —

1K/1Kは1,024トークン入力・1,024トークン出力、1K/8Kは1,024トークン入力・8,192トークン出力のワークロードです。AMDは代表値として、高interactivity(約90)で最大34倍、中(約70)で17倍、低(約30)で4倍を挙げています。

試験構成と注意点

  • 推論スタック: 両GPUともAMDのATOMを使い、DeepSeek-V4-Flashを単一GPUで提供
  • 比較単位: MI455X 1基対MI355X 1基。MI355Xは8基構成のシステムのうち1基のみを使用
  • MI455X環境: プレリリースのHelios bringup platform
  • 集計: 各マイクロベンチマークを5回実行し、中央値を報告
  • 比較方式: 同一構成で比べるapples-to-applesと、GPUごとに個別チューニングするpeak-to-peakを、ベンチマークごとに使い分けています
  • 図: スループットはMI355Xのピークに正規化しています

AMDは、これらの結果を特定時点のスナップショットと位置付けています。MI455Xのソフトウェア対応は成熟途中で、今後のROCmやフレームワークのリリース、ソフトウェアバージョン、ワークロード、システム構成によって数値は変わるとしています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内