OpenAIは、フロンティアAIの強化学習トレーニングに向けた「安全ケース(safety cases)」の初期ガイドラインを公開しました。フロンティア強化学習のトレーニングランを継続する前に、構造化された安全文書を要求すべきだという立場を示しています。
OpenAIは人工知能の研究と社会への導入を手がける企業で、GPTモデル群やコーディングエージェントのCodexを提供しています。
何が新しいか
安全ケースは、航空や原子力などの安全重視産業で使われる、リスクに関する包括的・構造化された証拠ベースの論証としてOpenAIは説明しています。OpenAIは、AIモデルでは能力の新たな段階ごとに創発的な複雑性が生じるため、航空や原子力と同等の厳密さを実現するのは難しいと述べ、安全ケースを現時点では目指すべき将来像(north star)として位置付けています。ガイドラインは内部プロセスの反復にあわせて今後進化する見込みだとしており、コミュニティからのフィードバックを求めるために現時点の考えを公開したとしています。
今回の文書はフロンティア強化学習トレーニングに焦点を当てたもので、内部・外部への展開ではより広範なアライメント特性を検討する必要があるとしています。
技術的安全策の3領域
安全ケースがカバーすべき技術スタックとして、OpenAIはアライメント訓練、封じ込め、モニタリングの3つを挙げています。モデルがミスアライメントな行動を取ろうとしないこと、仮に取ったとしても封じ込めの突破が難しいこと、そして危害が生じる前にモニタリングが検知することを確保する狙いだとしています。
| 項目 | 内容 |
|---|---|
| 自動データセットレビュー | エージェントを使い、悪用によって高報酬を得られる壊れたRL環境を発見・修正する |
| 手動データセットレビュー | 自動レッドチーミングを補い、手動レビューと品質確認で欠陥のあるタスクを特定する |
| 評価者(grader)の調整 | 訓練中に環境を悪用・ハッキングしようとする試みを罰するよう評価者を調整する |
| 過去ランの分析 | 過去の実験のトレースに分類器を実行し、評価者が意図どおり機能しているか確認する |
| オフラインのアライメント評価 | フロンティアランの最中に評価を実行し、実質的なリグレッションを調査する |
| バックテスト | 過去のインシデントでアライメント評価をバックテストし、特定インシデントへの過学習を防ぐ |
| 評価ゲーム化の追跡 | 評価認識やメタゲーミングを追跡し、具体的なブロッキング閾値を設定する |
| 最悪ケースのストレステスト | 最悪の不正挙動を引き出し、少なくとも1つの評価が検知することを確認する |
チェーン・オブ・ソートの取り扱い
OpenAIは、強化学習中に自動評価者へチェーン・オブ・ソートを見せないことを挙げています。モデルがチェーン・オブ・ソートのモニターを回避する方向に進化するのを防ぐためだとしています。訓練環境と評価の見直しについても、報酬ハックがミスアライメント行動を正の強化として定着させるのを防ぐことが目的だと位置付けています。

まだコメントはありません。