ComfyStreamerH3、MiniMax H3をRTX 5090 1台でライブ動画生成

スペック

配布形式・量子化FastVideoのプルーニング済みINT8チェックポイント、融合FP4 MLP、INT8 H3動画デコーダー

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

Comfy-Orgは、MiniMaxの動画モデルH3をRTX 5090(32 GB VRAM)1台でライブ生成するカスタムComfyUIノード兼ワークフロー「ComfyStreamerH3」をオープンソースで公開しました。複数の最適化を組み合わせ、VRAM要件を80 GBから30 GB未満まで下げています。

MiniMaxは文章、音声、画像、動画、音楽を扱うマルチモーダルモデルを開発するAI企業で、ComfyUIはノードをつないで生成ワークフローを組み立てるツールです。

検証の目標

原文はライブ動画モデルを連続稼働させると1日6,000ドル以上かかる点を課題に挙げ、一般向けGPU 1台でどこまで動かせるかを試しています。設定した要件は次のとおりです。

項目 条件
ハードウェア RTX 5090 1台(32 GB VRAM)
速度 15秒の動画を15秒以下で生成
解像度 448×256
品質 粗さやアーティファクトがあっても視聴可能

RTX 5090のレンタル価格は、安値で1時間あたり約70セントです。比較対象として、FastVideoのPreview V1はB200 1台で15秒・1344×768の動画を47.2秒で生成しています。

組み合わせた最適化

ベースはFastVideoのFastH3 V2チェックポイントを4ステップで実行する構成です。

手法 内容
4ステップサンプリング クリップあたりの計算量を削減
疎なアテンション(VSA) 選択した20%の動画ブロックにのみフルアテンションを適用し、約80%をスキップ(プロンプトは含める)
ClipProj(NicoLab28) Qwen3-VL-4BでH3の32Bエンコーダーを代替。15.7 GBが約4.5 GBに
プルーニング済みINT8チェックポイント FastVideo提供。重みの削除とINT8格納でメモリ削減
融合FP4 MLP MLPを4ビット演算・演算融合で軽量化。ByronLeeeeeのH3最適化を基にする
INT8 H3動画デコーダー(Kijai)+NVENC タイル単位でデコードし、完成タイルからNVENCでエンコードを並行実行

ワークフローはデコード済みフレームをすべてキャッシュせず、次のジョブ用に最終フレームだけを保持します。これらでVRAM要件は80 GBから30 GB未満となり、RTX 5090の32 GBに収まります。

試し方

  • https://github.com/Comfy-Org/comfystreamerh3 からカスタムComfyUIノードを取得します。
  • ワークフローではFastH3 V2チェックポイントを4ステップで実行します。
  • 自前のGPUがない場合は、READMEの手順に従ってComfy APIへデモをデプロイできます。Comfy APIがGPUホスティング、モデル、依存関係を扱います。

結果と今後

出力には粗さやアーティファクトが残り、原文も細部、一貫性、解像度に改善余地があると認めています。次の段階として、448×256で生成した動画をSolRefineryなどのアップスケーリングモデルで高解像度化する案を挙げ、予備テストでは3倍のGPUで7倍のピクセル密度が得られたとしています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内