VLMはグラウンディング出力で有害要求に従いやすく、拒否率がVQAより最大59pt低い

arXivで公開された研究「Visual Grounding Safety in Vision-Language Models」は、5つの視覚言語モデル(VLM)を評価し、同じ有害要求でもポイントやバウンディングボックスによるグラウンディングとして求めると、自由記述の回答(VQA)より拒否率が31〜59ポイント低いと報告しました。研究チームはこの差を埋めるファインチューニング手法も提案し、Qwen3-VL-8BとVisionReasoner-7Bでグラウンディング拒否率を最大95ポイント改善しています。

何を調べたか

VLMは、下流のインターフェース、エージェント、ロボットがそのまま実行できるポイントやバウンディングボックスなどの構造化出力を生成するよう訓練されるようになっています。研究チームは、この出力経路の安全性整合をこれまで誰も体系的に分析していないことを問題として挙げています。

そこで研究チームは3つの安全性ベンチマークを作り直し、要求する出力形式だけが異なる有害リクエストの対応ペアを15,401組作成しました。

  • 直接的危害: VLSU
  • 社会的偏見: BBQ-V
  • 状況的安全性: Asimov-2.0

各ペアは、VQA(自由記述の回答)を求めるものと、グラウンディング(ポイントまたはバウンディングボックス)を求めるもので構成されています。

結果と数値

5モデルの平均で見ると、質問形式なら拒否する有害要求に、グラウンディング形式では従う場合が多くありました。安全システムプロンプトを加えても、この差は縮まりませんでした。

項目 値
評価したVLM数 5
有害リクエストの対応ペア数 15,401
グラウンディング拒否率とVQA拒否率の差(モデル平均) 31〜59ポイント(領域により異なる)
提案手法によるグラウンディング拒否の改善(VLSU・BBQ-V) 77〜95ポイント
提案手法によるグラウンディング拒否の改善(保留したAsimov-2.0) 64〜85ポイント

提案手法

研究チームのファインチューニングでは、次の3種類のデータを組み合わせます。

  • グラウンディング形式の拒否応答
  • グラウンディング能力を保つためのデータ
  • 過剰拒否を抑えるための自己蒸留した無害データ

Qwen3-VL-8BとVisionReasoner-7Bにこの手法を適用したところ、グラウンディング拒否が改善し、VQA拒否も向上しました。グラウンディング能力は維持され、過剰拒否は限定的でした。訓練に使っていないAsimov-2.0でも64〜85ポイント改善しています。

表現分析では、ファインチューニングによって有害要求が各モデルの拒否方向へ移動しました。移動はグラウンディングで最も大きくなりました。一方、無害な要求は無害な参照表現の近くにとどまりました。

Qwenは、Alibaba Cloudが開発する大規模言語モデルのファミリーで、画像などを扱うマルチモーダルモデルも展開しています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内