研究チームは論文「Certification of Real Images through Calibrated Content Authentication」で、20のディープフェイク検出器を過去4年間に公開された10の生成モデルに対して評価し、精度が99.5%近くから76%へ低下したと報告しました。そのうえで、真正性そのものではなく「真正性がもっともらしく否認可能か」を校正して判定する検出パラダイムを提案しています。
何が新しいか
研究チームは、従来の検出器の不安定さを根本的な曖昧性に起因すると論じています。生成器は記憶などによって真正なコンテンツを完全に再現できるため、コンテンツだけからは真の来歴ラベルを確定できません。逆に、生成器が作ったコンテンツはその生成器自身で忠実に再構成できるはずです。提案手法は、既知のいずれかの生成器で忠実な再構成が見つかれば、合成由来がもっともらしく、真正性は否認可能と判定します。校正によって、既知の生成器のコンテンツが再現されない頻度に上限を設けます。
評価結果
| 項目 | 結果 |
|---|---|
| 評価した検出器 / 生成モデル | 20 / 10(過去4年間に公開) |
| 従来検出器の精度推移 | 99.5%近く → 76% |
| 敵対的摂動後の全ベースライン精度 | 2%未満(ラベルが実質的に反転) |
| 提案検出器の誤認証上限 | 既知の生成モデルが生成したコンテンツの1%以下 |
| 同じ動作点でのベースライン | 大半がほぼゼロのrecall(精度93%の最強ベースラインを含む) |
| 再現不能なReddit画像(2022年の生成器) | 3,000枚中1,116枚 |
| 再現不能なReddit画像(2024年の生成器) | 3,000枚中55〜79枚 |
適用条件と保証の範囲
- 1%の誤認証上限は、既知の生成モデルが生成したコンテンツが対象です。
- 攻撃サンプルでより厳格なセキュリティー閾値を校正すると、評価済みの有界摂動攻撃空間内では適応型攻撃に対しても上限を維持します。この攻撃空間の摂動は全ベースラインを破っています。
- 任意の敵対的変換は保証の対象外です。
背景と意味
研究チームは、Reddit画像の結果から事後検証可能性が低下していると述べています。2022年の生成器では3,000枚中1,116枚が再現できませんでしたが、2024年の生成器では55〜79枚にとどまりました。

まだコメントはありません。