AMD、ROCm 10.1でhipFILE強化とWSL2対応・LLVM 24移行

AMDは2026年10月5日、ROCm 10.1を発表しました。AMD Infinity StorageのhipFILE強化とHIPのNUMA対応ホストメモリ割り当てでデータ移動のボトルネックに対処し、あわせてROCm CLI v1.0.0、LLVM 24への移行、WSL2のtech previewなどを含めています。

ROCmはAMDが提供するGPU計算向けのオープンなソフトウェア群で、実行基盤、コンパイラー、数値計算ライブラリ、性能解析やシステム管理のツールを含みます。

データ移動の強化

AMDは、チェックポイント、KVキャッシュ、モデルパラメーターがGPU近傍の高速メモリを超えて大きくなり、ストレージからデバイスへの経路が最大のボトルネックになるとしています。ROCm 7.14で登場したAMD Infinity Storageは、CPUメモリを経由せずストレージとメモリ間でデータを移動するライブラリーで、10.1ではhipFILEに3つの改良を加えました。

機能 内容
Asynchronous Fast-Path Backend 読み書き要求をHIPストリーム上で直接実行し、ホストメモリでのステージングを省く。チェックポイントエンジンやKVキャッシュのオフロードでレイテンシーを下げ、持続スループットを上げる
Batch I/O API 複数のファイル要求をまとめて送信し、内部のワーカースレッドプールに分散する
Multi-Tier I/O Statistics hipFILEのテレメトリーをROCmのプロファイリングツールに渡し、演算・メモリ・データ供給のどれが律速かを判断しやすくする

HIPは仮想メモリ管理を拡張し、ホストメモリを特定のCPU NUMAノードに割り当てられるようにしました。RCCLなどのライブラリーは、これを使ってNUMAローカルなゼロコピー通信パイプラインを構築し、ソケット間のトラフィックを減らせます。

ROCm CLIとAMD Skills

ROCm CLI v1.0.0は、AMD GPU上でローカルAIワークロードのインストール、設定、実行を行う単一バイナリーのツールです。Linux、Windows、WSL2で動作します。

  • ROCm 10.0と10.1に対応し、vLLM向けに互換性のあるflash-attnとamd-aiterのwheelを自動検出します。
  • rocm installコマンドはROCm 10の「next」パッケージ構成に対応し、スクリプトやCI向けに完全な非対話型インストールを有効にするフラグを備えます。
  • フルスクリーンのTUIダッシュボードで、GPUテレメトリーとモデル配信・チャットを表示します。

AMD Skillsは、検証済みの設定をClaude CodeやCodexなどのコーディングエージェントが適用できる標準化された統合にまとめたものです。今回追加された3つのスキルは次のとおりです。

スキル 内容
ROCm Doctor LinuxとWindowsでROCm、HIP、PyTorchの失敗を既知の設定不良リストと照合して診断し、同意を得て低リスクの修正を適用するか、適切なアップストリームの窓口を案内する
quark-install アクセラレーターに合ったPyTorchビルドでAMD Quarkをインストールまたは検証し(PyPI、wheel index、ローカルwheel、ソース)、インポート、カーネル、quark-cliを確認する
quark-torch-llm-ptq PyTorch / Hugging Face LLMにポストトレーニング量子化を実行し、FP8、INT4などの方式選択を支援して検証済みの量子化モデルを生成する

開発者ツールとコンパイラー

  • ROCprofiler-SDKはkernel replay(beta)を導入し、カウンターグループごとにアプリを再実行せず1回の実行で全カウンターを収集します。PyTorchのKinetoやTritonのProtonが実行中の任意の時点で開始・停止できるようになり、rocprofv3のPCサンプリングをAIコーディングアシスタントに案内するエージェントスキルも加わりました。
  • ROCm Compute Profilerのrooflineレポートは対話型HTMLになり、PCサンプリング解析はカーネル単位・命令単位で結果を示します。vLLMのプロファイリングガイドも追加されました。
  • ROCm Systems ProfilerはLinuxでGorgon Point 1、2、3 APU(gfx1150、gfx1152、gfx1153)に対応しました。ROCm Optiqはrocprofv3に対応しました。
  • amdclang++はLLVM 23からLLVM 24に移行し、LTOがHIPデバイスコードを分割したパーティションをキャッシュしてインクリメンタルビルドを高速化します。ROCm 10.0からの移行ではメジャーバージョンが変わり、clang_majorは24を返すため、コンパイラーバージョンに依存するコードやビルドスクリプト、libLLVMに直接リンクするツールの確認が必要です。

ライブラリー、管理、環境対応

  • Composable KernelはRadeon GPUでのattentionを高速化し、量子化行列積の型を追加しました。MIGraphXはバックエンドをrocMLIRからrocMLIRTritonに切り替えました。rocSPARSEはELLPACK形式の行列で変換なしに三角求解を実行できます。
  • ROCm SMI(rocm-smi)の廃止期間が終了し、AMDは後継のamd-smiへの移行を推奨しています。amd-smiはPython、Rust、Goのバインディングを持ち、containerd、CRI-O、Podman、LXC、LXD、KubernetesポッドのGPUプロセスをコンテナIDとともに報告します。
  • WSL2対応はtech previewです。Windowsドライバーをインストールした後、ディストリビューション内にROCmを通常どおりインストールします。ゲストでのパッチ適用やカーネルビルドは不要で、PyTorchやHIPのワークロードがWSL2内からGPUを利用できます。
  • KVM SR-IOVはUbuntu 26.04 LTSをホストとゲストの両方で使えるようになり、ホスト側はGPU仮想化ドライバー(GIM)9.3.0.Kと組み合わせます。
  • hipThreadsはROCm Core SDKに加わり、標準C++のスレッド概念をGPU実行に対応付けます。LinuxとWindowsで、既存のCPUスレッドコードをHIPで全面的に書き直さずに段階的にGPU化できます。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内