OpenAIは、オンラインストレージ基盤「Habitat」を2024年半ばの小規模なPythonライブラリからグローバル分散ストレージプラットフォームへ進化させた経緯を公開しました。Habitatは現在、約40の地理的リージョンで毎秒7,000万件超のリクエストを処理し、週10億人超が使う製品と500PB超のデータを支えています。
OpenAIは人工知能の研究と社会への導入を手がける企業で、GPTモデル群やコーディングエージェントのCodexを提供しています。
規模と成長率
OpenAIによれば、システムエンジニアは通常10倍のスケールを見込んで設計し、それが数年もつことを期待しながら次の10倍に備えます。しかしHabitatの場合、過去3年間は毎年10倍超で成長してきました。そのため、既存スタックを最低レベルまで理解して性能を絞り出しつつ、ストレージと計算容量の逼迫をしのいで基盤投資の時間を稼ぐ、という戦術的な判断と順序付けの連続になったとしています。
| 項目 | 数値 |
|---|---|
| リクエスト処理 | 毎秒7,000万件超 |
| 利用者 | 週10億人超 |
| データ量 | 500PB超 |
| 展開リージョン | 約40の地理的リージョン |
| 年間成長率 | 過去3年、毎年10倍超 |
ライブラリからサービスへ
Habitatは「プロダクトエンジニアがデータベース管理を考える必要はない」という発想から出発しました。2024年半ばの時点では、ChatGPTのメインサーバーとやり取りする小さなPythonライブラリで、内部的にAzure Cosmos DBへマッピングされる限られた操作のみを提供していました。
Habitatが引き受けるのは、スキーマ参照、ルーティング、認可、暗号化、シリアライズ、リクエスト整形、コネクションプーリングです。データの取得元も製品側は意識せず、Azure Cosmos DB、キャッシュ、その他のストレージのいずれからでも扱えます。OpenAIはこのストレージロジックをライブラリから独立したサービスへ切り出すことで、デプロイ、可観測性、プラットフォーム拡張を一元管理する単一の制御点を確立しました。
何を支えているか
ログイン、Codex設定の確認、ChatGPTでの新しい会話の開始といった操作は、製品が応答するまでに多数の個別のデータ参照を必要とします。これらのリクエストが遅ければ製品は遅く感じられ、失敗すれば製品は完全に動作しなくなる、とOpenAIは説明しています。CodexはOpenAIのコーディングエージェントで、プロジェクト内のファイルを読み、コードを変更し、コマンドを実行して開発作業を進めるものです。
今回の記事はオンラインストレージのスケーリングに関する2部構成の第1部で、Habitatがどう進化したか、なぜライブラリからサービスへ変えたか、サービング用としては一般的でないPythonで書かれたサービスをストレージプラットフォーム層としてどこまで引き伸ばしたかを扱っています。続編では、大規模でのマルチテナンシーの信頼性、読み取り性能を最適化する階層的な戦略、Azure Cosmos DBとの連携をどうスケールさせたかを詳述するとしています。

まだコメントはありません。