Anthropicは2026年9月、報告書「Detecting and countering misuse of AI: September 2026」を公開し、2025年12月から2026年8月にかけてThreat Intelligence teamが特定・妨害したClaudeの悪用事例を、7つの危害領域にわたってまとめました。悪用にはClaude Haiku、Sonnet、Opusが使われ、Claude FableおよびMythos-classモデルは不正な蒸留の1件を除き悪用事例で確認されませんでした。
AnthropicはAIの安全性と研究を専門とし、Claudeを開発する企業です。Claudeは同社の大規模言語モデルのファミリーで、推論やエージェント作業を想定したモデルを提供しています。
報告の範囲と対象モデル
| 項目 | 内容 |
|---|---|
| 対象期間 | 2025年12月〜2026年8月 |
| 危害領域 | 7領域(サイバー作戦、影響工作、監視、詐欺・不正、生物学的悪用、通常兵器開発、不正な蒸留) |
| 悪用が確認されたモデル | Claude Haiku、Sonnet、Opus |
| 悪用が確認されなかったモデル | Claude Fable、Mythos-class(不正な蒸留1件を除く) |
| 過去の脅威報告 | 2025年3月、8月、11月 |
サイバー分野については、悪意ある活動がClaude FableまたはMythosで確認されなかったとしています。報告書が扱う脅威アクターは、疑われる国家支援グループ、金銭目的の犯罪者、商用スパイウェア事業者、国家プロパガンダ機関、政治的動機を持つ個人です。事例には、利用者をだます偽の出会い系アプリのネットワークや、反体制派を特定・監視する監視システムが含まれます。Anthropicは、これらは典型的な悪用ではなく、これまでに特定した中で最も注目すべき新しい脅威活動の例だと位置づけています。
サイバー作戦の評価軸「uplift」
報告書はサイバー作戦の章で、AIを悪用したアクターに対する内部呼称としてGenerative Threat Groups(GTGs)を用い、AIの能力向上分を「uplift」として速度・規模・深度の観点から測ろうとしています。Anthropicは、AIが大規模にエクスプロイトを開発するリスクに注目が集まりがちだが、リスクはサイバーキルチェーン全体でより顕著であり、攻撃者がより速く、より広く深い攻撃面にわたって、より少ないリソースで活動できるようになる点を挙げています。
読み方と対応
報告書はダウンロードして閲覧でき、サイバー作戦、監視作戦、影響工作、通常兵器、生物学的悪用、詐欺・不正、不正な蒸留の各領域ごとに事例が読めます。Anthropicは各事例で活動を妨害し、得られた知見を安全対策の強化に用い、適切な場合には当局や業界パートナーと情報を共有したとしています。また、洗練され持続的な脅威アクターが安全対策を継続的に試し、検知・防止の技術的措置を回避しようとしているとし、今後も安全対策を発展させると述べています。公開の狙いとして、他の開発者が自社プラットフォームで同様のパターンを認識できるようにすること、政府や市民社会に新興脅威の形成過程を示すこと、集団防御を強化することを挙げ、モデルの能力向上に伴いリスクは増加し得るため、AI開発者と社会の防御側が安全性向上に取り組む必要があるとしています。
この報告書はHacker Newsで82ポイント、147コメントを集めています。

まだコメントはありません。