OptimAI-Labは、LLMのアンラーニングを出力レベルで評価しても隠れ表現に機密情報が残り得ることを理論分析と実験で示し、これに対処するアンラーニング目的「Probe-Adversarial Representation Suppression(PARS)」を提案した論文を公開しました。コードはhttps://github.com/OptimAI-Lab/HiddenStateUnlearningで公開されています。
出力抑制と表現消去の分離
LLMのアンラーニングは通常、モデルが機密・不適切な内容を抑制しているかを出力レベルで評価します。研究はこうした評価が「忘却の錯覚」を生み得ると指摘し、理論分析によって出力抑制と表現レベルの消去が根本的に分離することを示しました。具体的には、デコーダを機密方向に対して任意に鈍感にして出力レベルの漏洩をゼロへ追い込んでも、隠れ表現は元の情報を保持し得るとしています。
層ごとの漏洩測定と検証結果
この現象を実証するため、研究はTransformerの各層の隠れ状態上で生成プローブデコーダを訓練し、層ごとの情報漏洩を測定しました。広く使われる3つのベンチマーク(TOFU、MUSE、WMDP)と最先端のアンラーニング手法を対象に検証したところ、標準的な出力レベル指標がアンラーニング成功を示している場合でも、隠れ表現から相当量の機密情報を復元できました。
PARSの位置づけ
PARSは、隠れ表現から抽出可能な情報を敵対的に最小化するアンラーニング目的です。表現レベルの漏洩を直接対象とし、敵対的プロービングおよび再学習攻撃の下での消去保証を強化し、評価したすべてのベースラインを上回ったとしています。研究は、LLMにおける真の忘却には出力の制御だけでなく、隠れ表現に符号化された情報の制御も必要だと結論づけています。

まだコメントはありません。