OpenAIは、NVIDIA Blackwell GPU上で動作するGPT-6 Astra UltrafastをOpenAI APIと、対象資格を持つChatGPT WorkおよびCodexユーザー向けに提供開始しました。トークン生成速度はAstra Standard mode比で最大8倍です。
何が新しいか
Ultrafastは、OpenAIが自社モデルを使って行った推論最適化により高速化したAstraの提供形態です。最適化はNVIDIA Blackwellアーキテクチャの機能を活用しています。
| 項目 | 内容 |
|---|---|
| モデル | GPT-6 Astra Ultrafast |
| GPU基盤 | NVIDIA Blackwell GPUs |
| 速度 | Astra Standard mode比で最大8倍のトークン生成速度 |
| 提供先 | OpenAI API、対象資格を持つChatGPT Work・Codexユーザー |
利用方法
開発者はOpenAI APIを通じて当日から利用できます。アクセス、価格、実装の詳細はOpenAIのUltrafast guideにまとめられています。
背景と意味
NVIDIA Blogは、生成の高速化によってコーディングエージェントの編集・テスト・デバッグのサイクルが短くなり、ツール呼び出し間の応答生成時間が減り、インタラクティブアプリケーションの応答性が上がると説明しています。エージェントがコードを書き、ツールを使い、結果を確認して次の行動を決めるという反復の中で、速度の差が積み重なるという位置づけです。
OpenAIの推論責任者Philippe Tillet氏は、NVIDIAのツールとドキュメントへの投資によって自社モデルがBlackwellやRubin GPUのプログラミングに長けるようになり、Astraがその知識を高性能カーネルに変換できると述べています。OpenAIのコンピュート部門CTOであるUday Ruddarraju氏は、社内モデルでNVIDIA GPU上の推論を最適化し、NVIDIAのプログラマビリティがAstra Ultrafastの高速化を支えたと話しています。
OpenAIはデプロイ後も自社モデルで推論ソフトウェアの改良を続けるとしています。記事は、プログラマブルなNVIDIAのプラットフォームの特性として、モデルの進化に応じてトレーニング、推論、強化学習の間でインフラを再利用でき、需要の変化に合わせた計算資源の転用で利用率を高められる点を挙げています。

まだコメントはありません。