Google、長編動画を自律生成するマルチエージェント基盤を発表

GoogleのResearch ScientistであるYale SongとYiwen Songは2026年9月24日、時間的一貫性のある長編動画ナラティブを自律生成する統合マルチエージェント・フレームワーク「AI video co-director」を発表しました。GeminiとVeoの上に載るオーケストレーション層として動作し、数分間の動画を生成しながら視覚的ドリフトとパイプラインのエラー伝播を緩和したとしています。

なお、GeminiはGoogle DeepMindが開発するAIモデルのファミリーで、文章・画像・音声・動画を扱うマルチモーダル理解や、推論・コード作成・外部ツールを使う多段階の課題処理に対応します。

何が新しいか

従来のエージェント的パイプラインは、独立した手作りのプロンプトを連結する構成のため、ショット間でキャラクターの衣装や背景がわずかに変わる semantic drift や、上流のアセット不具合が下流の動画合成を壊す cascading failures が起きていました。原文は、終端での失敗を特定のプロンプトまで遡れない古典的な credit assignment problem としてこの構造を整理し、さらにエンティティや環境が意図せず徐々に変化する feature drift、物語が意味のある形で進展しない content collapse も既存手法の問題として挙げています。

AI video co-directorは、長編動画生成を世界状態の追跡とグローバル最適化の問題として扱い、マルチショットの物語における視覚的連続性を明示的に計画します。品質をテスト時の目的関数としてモデル化することで、創作の合成処理と一貫性の維持を分離する設計です。

仕組みと構成

階層的パラメータ化が中核で、マルチアームド・バンディット(MAB)が有望な創作方針を全体的に特定します。原文はこれを、新しい物語戦略の探索と有効な創作構成の活用の最適バランスを探す探索問題として定式化したものと説明しています。システムは抽象的な創作軌道(情報提供型の戦略、vignette型のナラティブモード、特定の美的アーキタイプの組み合わせなど)をサンプリングし、それをサブエージェントのシステムプロンプトへ動的に注入します。このトップダウンの操舵によって、パイプライン全体が統一されたビジョンの下で動作します。

フレームワークは高レベルの人間による創作指定を実行へ変換し、マルチモデル・プロンプト、ショット連結、閉ループの映像改善といった反復的なオーケストレーション作業を自動化します。

項目 内容
基盤 Gemini と Veo
位置づけ オーケストレーション層
全体最適化 マルチアームド・バンディット(MAB)
自動化範囲 マルチモデル・プロンプト、ショット連結、閉ループの映像改善
安全機構 SynthIDの透かしなどを継承

関連フレームワークと評価

Googleは長編生成をグローバル最適化と世界状態追跡の問題として扱う一連のフレームワーク群として、Co-Director、CANVAS、A²RD、VQQAを挙げています。Co-DirectorはCOLM 2026、CANVASはEMNLP 2026での発表予定とされています。研究は長尺動画の課題を4つの基礎的な柱に分解し、それぞれが生成パイプライン上の特定のボトルネックに対応する構成です。

包括的評価では、マルチショットの物語的一貫性とキャラクター持続性が向上し、数分間の動画生成において視覚的ドリフトとパイプラインのエラー伝播を緩和したと報告されています。フレームワークはGeminiとVeoを基盤とし、SynthIDの透かしなどの安全機構を継承するとしています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内