研究者らは、明示的に定義された原則(constitution)に沿う行動を合成コーパスから低ランクアダプターやステアリングベクトルといった軽量オブジェクトへ蒸留し、推論時の介入としてミスアラインメントと悪用の緩和に用いる手法「constitutional adapters(CAs)」を提案・検証しました。学習中に有害要求や脱獄を一度も見せていないにもかかわらず、脱獄防御成功率と測定アラインメントが向上したと報告しています。
手法
手順は、まず合成コーパスから憲法と整合する行動を低ランクアダプターまたはステアリングベクトルとして蒸留します。次に、制御用に学習したオブジェクトを憲法用に学習したオブジェクトから差し引くことで効果を強め、これをconstitutional adapters(CAs)と呼んでいます。
特性と適用条件
| 項目 | 内容 |
|---|---|
| 学習時の有害要求・脱獄 | 使用していない |
| 蒸留先のオブジェクト | 低ランクアダプター、ステアリングベクトル |
| 効果が顕著な条件 | 長いコンテキスト長、マルチターン攻撃 |
| 比較対象 | プロンプトによるベースライン、ステアリングによるベースライン |
| モデル間転移 | ベースモデルで学習し、ポストトレーニング済みチェックポイントへゼロショット転移 |
| 推論時の調整 | CAsの強度をスケーリングし、防御と無害な要求への従順性をトレードオフ |
位置付け
原文は、明示的な原則に従う行動を軽量なオブジェクトへ蒸留する点と、長コンテキストおよびマルチターン攻撃でプロンプト・ステアリングの両ベースラインを上回った点を挙げ、CAsをAPI展開向けの軽量・ポータブル・調整可能な対策として位置付けています。

まだコメントはありません。