arXivで公開された論文「Passing the Test You Trained On」は、MetaのPrompt Guard 2を含む15種のプロンプトインジェクション検出器と2種のタスク認識型LLM判定器を再評価し、BIPIAで最良の検出器がAgentDojoでは偽陽性率1%でインジェクションの2%しか検出できないことを示しました。公開ベンチマーク間で検出性能の順位は十分に移行しないというのが結論です。
何を検証したか
LLMエージェントではツール出力を小規模なプロンプトインジェクション検出器で検査することが増えており、チームは公開ベンチマークのスコアで検出器を選んでいます。著者らは、そのスコアがエージェント内での挙動を予測するかを問いました。
評価手法は次のとおりです。
- AgentDojoとtau-benchの正解ツール呼び出しをLLMなしで再実行し、構造上良性のツール出力を得る
- 差分再実行(differential replay)でインジェクションを含む出力にラベルを付ける
- これらのツール出力とBIPIAベンチマークの両方で検出器を評価する
主な数値
| 項目 | 結果 |
|---|---|
| 評価した検出器 | 15種(Prompt Guard 2を含む) |
| タスク認識型LLM判定器 | 2種 |
| BIPIA最良の検出器のAgentDojo検出率 | 2%(偽陽性率1%) |
| AgentDojoで72%検出した検出器のtau-bench検出率 | 15% |
| ツール出力に対する偽陽性率 | 0%から90%超 |
検出率の順位はベンチマーク間で移行しませんでしたが、ツール出力に対する偽陽性率はAgentDojoとtau-benchの2つのエージェントベンチマーク間で移行しました。
訓練データの形式が結果を左右
訓練データが公開されている検出器では、訓練入力の形式で結果を説明できると論文は述べています。BIPIAのリーダー検出器はBIPIAの全入力で訓練されていましたが、InjecAgentの攻撃文字列を短いプロンプトとして見ていても、それをツール出力内で見つける助けにはなりませんでした。一方、AgentDojoとtau-benchの両方で最良だった検出器は、いずれのベンチマークともデータを共有せず、エージェント形式の入力で訓練されていました。
評価への提言
著者らは、導入判断のための評価では次の3点を求めています。
- エージェント自身のツール出力を使う
- 低い偽陽性率での検出性能を報告する
- 検出器の訓練データを監査する
なお、Prompt Guard 2の開発元であるMetaは、Facebook、Instagram、WhatsApp、Messengerなどのサービスを運営する企業です。

まだコメントはありません。