OpenAI、GPT-6ファミリーの運用ガイドを公開 推論レベル5段階を整理

OpenAIは、GPT-6ファミリーをスタートアップがプロトタイプ開発やコードリポジトリ・データベース・外部APIをまたぐワークフローで使うためのモデルガイドを公開しました。モデル選択、reasoning effort、プロンプトとスキル、ツール連携、数時間から数日に及ぶ長時間タスク、プロダクション運用までを扱っています。

モデルと推論レベルの選び方

ガイドは、モデル選択と推論レベルを知能と価格のトレードオフとして捉え、能力・コスト・レイテンシーのバランスを取るよう求めています。

モデル 想定用途
GPT-6 Astra 最大の知能が必要な最難関の推論
GPT-6.1 Sol 複雑なコーディング、リサーチ、computer use
GPT-6 Luna 請求書項目の抽出、リクエスト分類、構造化要約など明確な目的の反復作業

APIのreasoning effortは次の段階から選びます。

レベル 用途
Low 事実抽出や小さな編集
Medium 機能の計画や選択肢の比較など判断を伴う作業
High 難しいデバッグ、深い分析、慎重なレビュー
Extra high / Max Highで不十分な場合に対応環境でテストし、改善が追加時間・コストに見合う場合のみ維持

Codexでは各モデルのデフォルトから始め、簡単なタスクで下げ、深い分析で上げるとしています。速度面では、APIのFast modeがStandardより高いトークン単価で速く安定した応答を返し、CodexとAPIのUltrafastはreasoning effortとは独立にトークン生成を高速化します。UltrafastはGPT-6 Astraで利用できます。

プロダクション前の準備

  • 代表的なタスクを実行し、タスク成功率、レイテンシー、成功タスクあたりのコストを測定する。
  • prompt cachingでは、安定した指示や参照資料を変化するタスク詳細より前に置き、ツール定義を一貫させる。キャッシュされた入力トークンは、モデルにより非キャッシュより最大95%安くなります。ワークフロー全体のコスト見積もりにはキャッシュ書き込みと長コンテキスト料金を含めます。
  • 長い会話ではcompactionで、継続に必要な状態を保ったままコンテキストを縮小する。
  • 不要なコンテキストを削り、独立タスクは並列実行する。挙動の監視方法とデータコントロールも事前に決めます。

プロンプトとAGENTS.md

OpenAI Developer ExperienceのEric Provencher氏は、求める結果、対象者、文脈と制約、完了条件を示す明確な課題設定から始めるよう述べています。ガイドは、スキルの説明を短くし実行タイミングを明示すること、AGENTS.mdで使い捨てデータと本番アクセスなしのローカルテストのような安全な定型作業を明示的に許可すること、一律の「常に確認」ではなく自律実行と承認が必要な操作の境界を定めること、「完了」に実装・実行・結果確認・失敗修正を含めることを推奨しています。

長時間タスクとcomputer use

APIでは、Responses WebSocket API経由のmid-turn steeringで実行中に修正を送れます(更新はキューに入り、実行中のツールや完了済み操作は取り消しません)。非同期ツール呼び出しではテストなど遅い処理の間も独立作業を続け、依存する作業はツール結果を待ってから始めます。GPT-6.1 SolはResponses APIのマルチエージェントワークフロー(ベータ)に対応し、サブエージェントに独立作業を割り当てて結果を統合します。CodexではGPT-6 Astraが作業中に確認を求められ、要件変更時はアクティブなタスクをsteerできます。

Computer useでは3モデルともAPIのないウェブサイトやデスクトップアプリを操作できます。ガイドは、直接こなせる場合はAPIや接続ツールを優先し、画面の読み取りやクリック、フォーム入力が必要な場合にcomputer useを使うよう勧めています。自前のアプリに組み込む場合は、ブラウザーにPlaywright、デスクトップアプリにPyAutoGUIを使えると説明しています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内