AMD、Strix HaloミニPCでVLAモデルMolmoAct2をROCm実行

スペック

重みの公開完全にオープンソースの重み

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

AMDは2026年9月30日、ROCm Blogsで、視覚・言語・行動(VLA)ロボットポリシー「MolmoAct2」を単一のAMD Ryzen AI Max+ 395「Strix Halo」ミニPC上でROCmを使って実行する手順とデモを公開しました。クラウドや外部アクセラレーターは使わず、Ryzersコンテナから数コマンドで起動できます。記事の著者はMir Sayeed Mohammad、Sarunas Kalade、Graham Schelleの3名です。

Ryzen AI Max(旧コードネームStrix Halo)は、Zen 5のCPUコアにRadeonの内蔵グラフィックスとNPUを組み合わせたAMDのプロセッサです。

何が新しいか

MolmoAct2は、カメラ画像と自然言語指示を入力として受け取り、ロボットのモーター動作を出力するVLAモデルです。重み・学習コード・データを完全にオープンソースで提供しています。ベースのMolmoAct2-ERは、SigLip2ビジョンエンコーダーとQwen3-4B言語バックボーンに、将来動作の短い「チャンク」を生成するflow-matchingのaction expertを組み合わせた構成です。ポリシーはエンドエフェクター座標で出力し、関節動作は逆運動学を使う標準コントローラーが計算します。

AMDはこの設計を利用して、以下のデモを1つのパッケージにまとめています。

  • ブラウザーからのPanda arm操作(MuJoCo/LIBERO)
  • 再学習なしでUR5e、xArm6へ転移するゼロショット・クロス・エンボディメント
  • 非同期リアルタイム計画
  • LIBEROでの閉ループ評価
  • DROID実データでのオープンループ再生

学習データは、Panda arm、Bimanual YAMs、SO101の3種類のロボット実施形態から集めたものです。記事によると、Ryzen AI Max+ 395は内蔵GPUと大容量のユニファイドメモリを備えるため、VLAモデルを卓上機で保持・実行できます。

試し方

Ryzersは、Ryzen AIハードウェア上でROCm Dockerコンテナをビルド・実行するAMDの軽量フレームワークです。

git clone https://github.com/AMDResearch/Ryzers
pip install Ryzers/
ryzers build molmoact2
ryzers run

コマンドを付けずにryzers runを実行すると、軽いROCm動作確認を行います。モデル重みとデータセットは初回利用時にHugging Faceキャッシュへダウンロードし、以降は再利用します。export HF_TOKEN=...を設定するとダウンロードが速くなります。ryzers run /ryzers/download.shを使えば事前にキャッシュへ取得できます。

用途 コマンド 備考
インタラクティブ操作 ryzers run /ryzers/demo_interactive.sh http://localhost:8080。深度推論を有効にするにはTHINK=1
UR5e / xArm6 EMBODIMENT=ur5e ryzers run /ryzers/demo_interactive.sh UR5eはRobotiq 85グリッパー装着。EMBODIMENT=panda|ur5e|xarm6
非同期リアルタイム ryzers run /ryzers/demo_interactive_rt.sh http://localhost:8081。デフォルト1200ステップ、RT_MAX_STEPS=3000などで変更可能
LIBERO閉ループ評価 SUITE=libero_object TASK_ID=3 ryzers run /ryzers/demo_libero.sh スイートはlibero_10/libero_goal/libero_object/libero_spatial、タスクIDは0〜9
DROIDオープンループ再生 EPISODE=42 ryzers run /ryzers/demo_droid.sh シーン動画と、予測と実測を比べた行動プロットを出力

同期型のインタラクティブデモは、デフォルトで任意の段階的深度推論(MolmoAct2-Think)を省略した高速経路で動きます。高速なインタラクティブ実行の設定はTHINK=0とNUM_STEPS=4です。生成した動画とプロットはローカルのoutputsフォルダーに保存されます。

リアルタイム実行の仕組み

リアルタイムサーバーは、MuJoCoを実時間で動かしながら、ポリシーが次の行動チャンクをバックグラウンドで計画します。計算中、ロボットは現在の姿勢を保持し、新しい計画ができ次第それに切り替えます。AMDはこの非同期構成を実機で必要になる構成と位置づけており、ロボットが停止せずに済むほど計画を高速化することを研究課題に挙げています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内