NVIDIA、TensorRTのマルチGPU推論をDynamo-Tritonに統合

NVIDIAは、NVIDIA Dynamo-TritonでTensorRTのマルチデバイス推論を統合し、単一のTensorRTネットワークを複数GPUにまたがって実行できるようにしました。正式サポートはTensorRT 11.0以降です。NVIDIAはGPUを含むチップやコンピューターシステム、ソフトウェアを開発する企業です。

何が新しいか

TensorRTマルチデバイス推論は、NCCLをバックエンドとする分散コレクティブを使って、1つのTensorRTネットワークを複数GPU上で実行する機能です。分散実行を行いながら、TensorRTの推論最適化を維持する点をNVIDIAは挙げています。

仕様と利用条件

項目 内容
機能 TensorRTマルチデバイス推論
統合先 NVIDIA Dynamo-Triton
分散通信 NCCLをバックエンドとする分散コレクティブ
実行単位 単一のTensorRTネットワークを複数GPUで実行
正式サポート TensorRT 11.0 以降

試し方

NCCLをバックエンドとする分散コレクティブを使用して、単一のTensorRTネットワークを複数GPUで実行します。利用にはTensorRT 11.0以降が必要です。

背景

NVIDIAは、生成AIの計算量とメモリ需要が単一GPUで提供できる範囲を超えつつある状況を、この機能の背景として説明しています。複数GPU上で実行しつつTensorRTの推論最適化を保つことが狙いです。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内