研究チームは、LLMの安全性に関わる「抑制された特徴」を定量化する指標Counterfactual Activation Potential(CAP)と、その探索手法CAP-guided Safety Feature Discovery(CSFD)をarXivで提案しました。Gemma、Qwen、Llamaの5モデルで、自然なジェイルブレイク時に高CAP特徴への抑制が2〜4倍に増え、活性化が最大80%下がることを示しています。
何が新しいか
従来の機械論的解釈手法は、主に活性化しているニューロンや特徴を分析してきました。本研究は、残りの大量の非活性な要素の中に、有害プロンプトへの拒否に因果的に関与する安全性上重要な特徴があることを示しました。こうした特徴を抑制すると拒否がコンプライアンスに変わる一方、一般的な解釈ツールでは検出されません。
CAPは抑制された特徴の潜在的な活性化傾向を、次の3要素の積として定量化します。
| 要素 | 意味 |
|---|---|
| encoder alignment | 入力がその特徴をどれだけ強く駆動するか |
| suppression strength | 活性特徴がその特徴をどれだけ強く抑制するか |
| safety criticality | 拒否がその特徴にどれだけ依存するか |
CSFDは2段階のフィルタリングアルゴリズムで、網羅的なアブレーションを行わずに数十万のトランスコーダー特徴から候補安全特徴を特定します。
実験結果
| 条件 | 結果 |
|---|---|
| 候補特徴をアブレーション | 有意な割合の試行で有害プロンプトへの拒否がコンプライアンスに変化 |
| 自然なジェイルブレイク | 高CAP特徴への抑制が2〜4倍に増加、活性化は最大80%低下 |
| 抑制因子を増幅 | 対象特徴の活性化が下がり、関連プロンプトへの有害なコンプライアンスが増加。ランダムな特徴では同様の効果なし |
| 対象モデル | Gemma、Qwen、Llamaの各種パラメータ規模の5モデル |
GemmaはGoogle DeepMindなどGoogleのチームが開発し、モデルの重みと開発用ツールを提供するオープンなモデルファミリーです。QwenはAlibaba Cloudが、LlamaはMetaが開発し、それぞれモデルの重みを公開している大規模言語モデルのファミリーです。
背景と意味
著者らは、ジェイルブレイクが有害な特徴を活性化するだけでなく、安全性上重要な特徴を抑制することで部分的に機能している可能性を指摘しています。そのうえで、抑制された特徴の分析は、活性化に焦点を当てた安全性解釈を補完するために必要だと結論づけています。

まだコメントはありません。