NVIDIAは、NVIDIA Dynamo-TritonでTensorRTのマルチデバイス推論を統合し、単一のTensorRTネットワークを複数GPUにまたがって実行できるようにしました。正式サポートはTensorRT 11.0以降です。NVIDIAはGPUを含むチップやコンピューターシステム、ソフトウェアを開発する企業です。
何が新しいか
TensorRTマルチデバイス推論は、NCCLをバックエンドとする分散コレクティブを使って、1つのTensorRTネットワークを複数GPU上で実行する機能です。分散実行を行いながら、TensorRTの推論最適化を維持する点をNVIDIAは挙げています。
仕様と利用条件
| 項目 | 内容 |
|---|---|
| 機能 | TensorRTマルチデバイス推論 |
| 統合先 | NVIDIA Dynamo-Triton |
| 分散通信 | NCCLをバックエンドとする分散コレクティブ |
| 実行単位 | 単一のTensorRTネットワークを複数GPUで実行 |
| 正式サポート | TensorRT 11.0 以降 |
試し方
NCCLをバックエンドとする分散コレクティブを使用して、単一のTensorRTネットワークを複数GPUで実行します。利用にはTensorRT 11.0以降が必要です。
背景
NVIDIAは、生成AIの計算量とメモリ需要が単一GPUで提供できる範囲を超えつつある状況を、この機能の背景として説明しています。複数GPU上で実行しつつTensorRTの推論最適化を保つことが狙いです。

まだコメントはありません。