OpenAIは2026年9月10日、フルデュプレックス音声モデルGPT-Live-1をAPIで提供開始しました。ChatGPTで先に導入されたモデルで、入力音声の聞き取りと出力音声の発話を同時に処理し、深い推論やツール呼び出しはバックエンドのテキストモデルへ委譲できます。
何が新しいか
従来の音声エージェントはSTT・推論モデル・TTSを連結する構成で、各段の受け渡しごとにレイテンシが加わり、タイミングや文脈、会話のリズムを失う箇所が増えます。割り込みや沈黙、話題の転換に何が起きるかの調整も開発者側の作業になります。GPT-Live-1は聞き取りと発話を単一モデルで扱い、入ってくる音声と出ていく音声をまとめて推論することで、割り込みや相づちにその場で応答しつつ、深い推論はバックエンドに回して会話を継続させます。
早期評価を実施したSpeakでは、言語チューターが応答する前に学習者が考える時間が増え、従来のターン制システム比で割り込みがほぼ80%減ったとしています。導入事例では、共同創業者兼CTOのTony Stoyanov氏が、カスケード構成と比べてコードベースを80%簡素化し、23K行のコードを削除したとコメントしています。
API版の主な機能
| 項目 | 内容 |
|---|---|
| 割り込み処理 | 入出力音声をまとめて推論する単一モデルで処理し、連結型STT–LLM–TTSのレイテンシと脆い受け渡しを回避 |
| 推論・ツール呼び出しの委譲 | GPT-6 Astraのようなバックエンドのテキストモデル、または第三者モデルへ委譲 |
| トーン・話速・スタイル | システムプロンプトでエージェントのトーン、話す速さ、会話スタイルを調整 |
| 無音・背景ノイズ | 会話を中断せず、逐一を音声で説明せずに処理 |
| 長時間セッション | 長い対話をまたいだ文脈保持と会話品質を改善 |
| テレフォニー | 電話向けのフルデュプレックス音声エージェントとして展開。レストラン予約からカスタマーサポートまで |
| 文字起こし | ASRトランスクリプトと応答テキストをネイティブに提供。キーワード・バイアスにも対応 |
試し方と構成の選択
開発者はAPI経由でGPT-Live-1を音声対応アプリや業務ワークフローに組み込み、会話の背後に置くモデル、ツール、エージェント・ハーネスを自分で選びます。例として、スケジューリングや注文状況の更新といった大量処理のタスクにはLunaのようなモデルを組み合わせ、推論を要する複雑な顧客対応にはAstraのようなモデルを使う構成が挙げられています。エージェントの話し方の制御はシステムプロンプトで行います。
背景
OpenAIは人工知能の研究と社会への導入を手がける企業で、GPTモデル群やコーディングエージェントのCodexを提供し、開発者向けAPIから各機能を利用できます。GPT-Live-1はCodexやChatGPT Workで見られたように、組み合わせたモデルやツールへ深い推論と実行を委譲する形をとります。

まだコメントはありません。