OpenAI、フルデュプレックス音声モデルGPT‑Live‑1をAPIで提供開始

OpenAIは2026年9月10日、フルデュプレックス音声モデルGPT-Live-1をAPIで提供開始しました。ChatGPTで先に導入されたモデルで、入力音声の聞き取りと出力音声の発話を同時に処理し、深い推論やツール呼び出しはバックエンドのテキストモデルへ委譲できます。

何が新しいか

従来の音声エージェントはSTT・推論モデル・TTSを連結する構成で、各段の受け渡しごとにレイテンシが加わり、タイミングや文脈、会話のリズムを失う箇所が増えます。割り込みや沈黙、話題の転換に何が起きるかの調整も開発者側の作業になります。GPT-Live-1は聞き取りと発話を単一モデルで扱い、入ってくる音声と出ていく音声をまとめて推論することで、割り込みや相づちにその場で応答しつつ、深い推論はバックエンドに回して会話を継続させます。

早期評価を実施したSpeakでは、言語チューターが応答する前に学習者が考える時間が増え、従来のターン制システム比で割り込みがほぼ80%減ったとしています。導入事例では、共同創業者兼CTOのTony Stoyanov氏が、カスケード構成と比べてコードベースを80%簡素化し、23K行のコードを削除したとコメントしています。

API版の主な機能

項目 内容
割り込み処理 入出力音声をまとめて推論する単一モデルで処理し、連結型STT–LLM–TTSのレイテンシと脆い受け渡しを回避
推論・ツール呼び出しの委譲 GPT-6 Astraのようなバックエンドのテキストモデル、または第三者モデルへ委譲
トーン・話速・スタイル システムプロンプトでエージェントのトーン、話す速さ、会話スタイルを調整
無音・背景ノイズ 会話を中断せず、逐一を音声で説明せずに処理
長時間セッション 長い対話をまたいだ文脈保持と会話品質を改善
テレフォニー 電話向けのフルデュプレックス音声エージェントとして展開。レストラン予約からカスタマーサポートまで
文字起こし ASRトランスクリプトと応答テキストをネイティブに提供。キーワード・バイアスにも対応

試し方と構成の選択

開発者はAPI経由でGPT-Live-1を音声対応アプリや業務ワークフローに組み込み、会話の背後に置くモデル、ツール、エージェント・ハーネスを自分で選びます。例として、スケジューリングや注文状況の更新といった大量処理のタスクにはLunaのようなモデルを組み合わせ、推論を要する複雑な顧客対応にはAstraのようなモデルを使う構成が挙げられています。エージェントの話し方の制御はシステムプロンプトで行います。

背景

OpenAIは人工知能の研究と社会への導入を手がける企業で、GPTモデル群やコーディングエージェントのCodexを提供し、開発者向けAPIから各機能を利用できます。GPT-Live-1はCodexやChatGPT Workで見られたように、組み合わせたモデルやツールへ深い推論と実行を委譲する形をとります。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内