Comfy-Orgは、MiniMaxの動画モデルH3をRTX 5090(32 GB VRAM)1台でライブ生成するカスタムComfyUIノード兼ワークフロー「ComfyStreamerH3」をオープンソースで公開しました。複数の最適化を組み合わせ、VRAM要件を80 GBから30 GB未満まで下げています。
MiniMaxは文章、音声、画像、動画、音楽を扱うマルチモーダルモデルを開発するAI企業で、ComfyUIはノードをつないで生成ワークフローを組み立てるツールです。
検証の目標
原文はライブ動画モデルを連続稼働させると1日6,000ドル以上かかる点を課題に挙げ、一般向けGPU 1台でどこまで動かせるかを試しています。設定した要件は次のとおりです。
| 項目 | 条件 |
|---|---|
| ハードウェア | RTX 5090 1台(32 GB VRAM) |
| 速度 | 15秒の動画を15秒以下で生成 |
| 解像度 | 448×256 |
| 品質 | 粗さやアーティファクトがあっても視聴可能 |
RTX 5090のレンタル価格は、安値で1時間あたり約70セントです。比較対象として、FastVideoのPreview V1はB200 1台で15秒・1344×768の動画を47.2秒で生成しています。
組み合わせた最適化
ベースはFastVideoのFastH3 V2チェックポイントを4ステップで実行する構成です。
| 手法 | 内容 |
|---|---|
| 4ステップサンプリング | クリップあたりの計算量を削減 |
| 疎なアテンション(VSA) | 選択した20%の動画ブロックにのみフルアテンションを適用し、約80%をスキップ(プロンプトは含める) |
| ClipProj(NicoLab28) | Qwen3-VL-4BでH3の32Bエンコーダーを代替。15.7 GBが約4.5 GBに |
| プルーニング済みINT8チェックポイント | FastVideo提供。重みの削除とINT8格納でメモリ削減 |
| 融合FP4 MLP | MLPを4ビット演算・演算融合で軽量化。ByronLeeeeeのH3最適化を基にする |
| INT8 H3動画デコーダー(Kijai)+NVENC | タイル単位でデコードし、完成タイルからNVENCでエンコードを並行実行 |
ワークフローはデコード済みフレームをすべてキャッシュせず、次のジョブ用に最終フレームだけを保持します。これらでVRAM要件は80 GBから30 GB未満となり、RTX 5090の32 GBに収まります。
試し方
https://github.com/Comfy-Org/comfystreamerh3からカスタムComfyUIノードを取得します。- ワークフローではFastH3 V2チェックポイントを4ステップで実行します。
- 自前のGPUがない場合は、READMEの手順に従ってComfy APIへデモをデプロイできます。Comfy APIがGPUホスティング、モデル、依存関係を扱います。
結果と今後
出力には粗さやアーティファクトが残り、原文も細部、一貫性、解像度に改善余地があると認めています。次の段階として、448×256で生成した動画をSolRefineryなどのアップスケーリングモデルで高解像度化する案を挙げ、予備テストでは3倍のGPUで7倍のピクセル密度が得られたとしています。

まだコメントはありません。