arXivで公開された論文「Share-Borne AI Virus: Memory-Hopping Attacks Across LLM Agents」は、共有される永続アーティファクトを経由してLLMエージェント間に自己増殖する攻撃が成立することを示し、大規模なシミュレーション環境ではGPT-5.6 Lunaでもエージェントの60〜80%に攻撃が到達し、伝播チェーンが8ホップまで伸びたと報告しました。
アーティファクト媒介型の伝播
論文は、状態を保持するLLMアシスタントがツールを用いて永続的なアーティファクトを読み取り・変更・作成し、それがユーザー間で共有されることで、本来独立しているアシスタント同士に間接的な通信経路が生まれる点を出発点にしています。著者らはこの経路を使う失敗モードを「artifact-mediated propagation(アーティファクト媒介型の伝播)」と呼び、次の連鎖として定式化しました。
- レポートなどのアーティファクトを通じて敵対的コンテンツが持ち込まれる
- その内容がアシスタントの永続メモリに保存される
- 後続で作成されるアーティファクトに再現される
- それを後から読んだ別のアシスタントが取り込む
GPTは、OpenAIが開発するAIモデルのファミリーで、自然言語の指示に基づき文章やコード、構造化データなどを生成し、ツール呼び出しを組み合わせた処理にも対応します。
評価方法と数値
評価は、独立運用されるアシスタント間のアーティファクト交換を時間経過に沿ってモデル化した temporal human-agent universes 上で行われ、攻撃が引き継ぎ(hand-off)を越えて生存するか、何ホップまで到達するか、どこまで広く拡散するかを測定しています。
| 項目 | 内容 |
|---|---|
| 評価対象モデル(大規模環境) | GPT-5.6 Luna |
| 攻撃が到達したエージェントの割合 | 60〜80% |
| 伝播チェーンの到達ホップ数 | 8ホップ |
| 伝播の媒体 | レポートなどのアーティファクトに導入された敵対的コンテンツ |
| 測定指標 | 引き継ぎ後の生存、到達ホップ数、拡散範囲 |
論文は、攻撃が複数の独立したアシスタントにまたがって伝播し、長い対話シーケンスにわたって持続しうると述べています。
背景と意味
著者らは、永続アーティファクトが敵対的な状態の持続的なキャリアとして機能し、攻撃が個々の対話を超えて存続して、隔離されたアシスタント間にも広がりうると結論づけています。永続メモリを持ち、ツールでアーティファクトを読み書きするアシスタントと、そのアーティファクトがユーザー間で共有される構成自体が伝播経路になるという整理です。

まだコメントはありません。