CoreWeaveは米サンフランシスコで今週開催のCoreWeave Fully Connectedで、NVIDIA Vera Rubin NVL72システムとSpectrum-X 102.4T Ethernetネットワーキングの提供を発表しました。最初の本番顧客であるCognitionの初期テストでは、SWE-2推論でGB200 NVL72比最大4.8倍の総トークンスループットを示しています。
NVIDIAはGPUを含むチップ、コンピューターシステム、ソフトウェアを開発する企業で、CoreWeaveとはおよそ10年にわたり共同設計を続けてきたと原文は述べています。
Cognitionの実ワークロード検証
CognitionはDevin AIソフトウェアエンジニアの開発元で、Devinの学習、強化学習、本番推論をCoreWeave上で実行しています。CoreWeaveは今月初めに最初のVera Rubin NVL72本番ラックを受領し、数日でCognition向けの本番クラスタを立ち上げました。CognitionはFrontierCodeからタスクのサブセットをサンプリングしてAIエージェントに解かせるワークロードを作り、GB200 NVL72をベースラインに比較しました。結果は最大4.8倍の総トークンスループット向上です。CognitionのSilas Alberti氏は、エージェント型コーディングは長いコンテキスト、高い同時実行数、大量のトークンを伴い、トークン当たりコストが出荷できるものを左右すると述べています。
Vera CPUの数値
CoreWeaveはAIエージェント向けに設計したNVIDIA Vera CPUも提供します。サンドボックスはハードウェア分離され、Spectrum-X EthernetスイッチとBlueField-4 DPUで低レイテンシの通信を確保します。
| 項目 | 値 |
|---|---|
| 1ラック当たりCPU数 | 128 |
| 1ラック当たりコア数 | 11,264 |
| 同時エージェント環境数(1環境1コア) | 11,000超 |
| エージェントサンドボックス起動時間 | 3倍超高速 |
| Terminal-Bench(全合格タスク) | 1.7倍 |
提供条件と利用方法
- Vera Rubin NVL72はCoreWeave Cloudのアーリーアクセス顧客が対象です。
- 容量はCoreWeave Kubernetes Service、SUNK、CoreWeave Mission Control、CoreWeave Sandboxes、CoreWeave Inferenceを通じて運用できます。
CoreWeave Forge
CoreWeave Forgeは、Weights & Biases、OpenPipeのポストトレーニングの知見、オープンソースのmarimoノートブックを1つの環境に統合し、本番の挙動を次の学習に反映するループを構成します。モデル、フレームワーク、クラウドをまたいで利用できます。Canva、Capital One、MasterClassが初期の利用企業です。
| 機能 | 状況 | 内容・数値 |
|---|---|---|
| CoreWeave ARIA | 一般提供 | 実行分析、実験提案、コード変更提案とGitHubへの保存 |
| CoreWeave Agent Lens | 新サービス | 失敗検出20%改善、修正コスト半分 |
| CoreWeave Sandboxes | 一般提供 | 分離されたCPU/GPU環境でエージェント、ツール呼び出し、RL、評価を実行。サーバーレスまたは既存の学習基盤上 |
| Serverless SFT / Serverless RL | — | 独自レシピを試行可。RLは自己管理環境比1.4倍高速、40%低コスト |
| RL Rollouts | プライベートプレビュー | NVIDIA Dynamoで動作。稼働中のデプロイに再デプロイなしで新チェックポイントを読み込み |
NVIDIA Nemotronオープンモデルも、Forge上での推論・マルチモーダルモデルのカスタマイズとデプロイに使えます。
その他の導入例
15州で約50,000人の高ニーズMedicare患者にサービスを提供する在宅医療事業者Ennoble Careは、CoreWeave Kubernetes Service上で予約したNVIDIA RTX PRO 6000 GPU容量を使い、臨床文書作成、意思決定支援、バックオフィス自動化のAIエージェントを運用します。

まだコメントはありません。