Google Researchは2026年9月29日、画像生成の生成過程を制御してプロンプト適合性を高めるフレームワーク「Diffusion Controller」を発表しました。Software EngineerのChih-wei HsuとMoonkyung Ryuが執筆した記事によると、軽量な追加ネットワークが人間の嗜好適合で業界標準を上回り、内部重みを変更できる完全調整版はベースモデルに対して90%の勝率を達成しています。
Googleは検索やGoogle Workspace、YouTubeなどを提供する企業で、Google Researchなどの組織でAIの研究開発を進めています。
何が新しいか
Diffusion Controllerは、ランダムノイズから画像を段階的に精細化していくデノイズ過程全体を、孤立したステップの連なりではなく滑らかな連続制御問題として再定式化します。Google Researchは、推論時の制御手法(classifier-free diffusion guidanceなど)と、LoRAやreward-weighted regression、policy gradientといった重い微調整手法が従来は別個の対処法として扱われてきたため、生成モデルの制御を統一して分析・最適化する単一の数学的言語が欠けていたと説明しています。その結果、エンジニアはユーザー嗜好への適合と画質のバランスを取る際に当て推量に頼ることになっていたとしています。
記事では「サングラスをかけたトカゲ(a lizard wearing sunglasses)」というプロンプトを例に挙げ、サングラスのないトカゲが生成される場合と、サングラスを無理に入れさせるとトカゲの顔が崩れて画質が損なわれる場合があると述べています。
仕組みと適用条件
Diffusion Controllerは、ベースの事前学習済みモデルを完全に凍結したまま、軽量な「ステアリングダンパー」として追加ネットワークを接続します。各ステップでの誘導を推測するのではなく、画像生成中に生成軌跡を動的に調整し、ユーザー定義の目標(芸術的スタイルや文脈整合など)を最大化する方向に重みを寄せる形でモデルの既定挙動を再校正します。フィードバックによって生成軌跡のシフトを数学的に最適化することで、ベースモデルの鮮明な画質と安定性を保ちながら、新しいユーザー嗜好へ生成過程を誘導するとしています。
| 項目 | 内容 |
|---|---|
| 接続方式 | ベースの事前学習済みモデルに軽量な追加ネットワークとして接続(ベースモデルは凍結) |
| 対象モデル | アクセス制限のあるクローズドソースモデルにも接続可能 |
| 90%の勝率の条件 | "white-box"または内部モデル重みを変更できる無制限アクセスの完全調整済みモデル |
| 嗜好適合 | 軽量な追加ネットワークが人間の嗜好適合で業界標準を上回った |
記事は、text-to-imageモデルとしてNano Banana、Stable Diffusion、Fluxを挙げ、これらの巨大モデルを正確なユーザー意図や下流の目標、厳しい視覚制約に合わせて誘導することが依然として繊細で予測しにくい綱渡りであると位置づけています。また、複雑なプロンプトについて、ベースの事前学習済みモデル、LoRA、Diffusion Controllerの出力を並べた比較図を掲載しています。

まだコメントはありません。