NVIDIA、GLM-5.3をNVFP4量子化した753Bモデルを公開

スペック

総パラメータ753B
活性パラメータ40B
コンテキスト長最大1M
ライセンスNVIDIA Proprietary。ダウンロードはNVIDIA Open Model Agreement、基盤モデルはGLM-5.3 License
配布形式・量子化NVFP4
4bit量子化の目安メモリ約451.8GB(512GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

NVIDIAは2026年9月10日、ZAIのGLM-5.3をNVFP4形式に量子化したnvidia/GLM-5.3-NVFP4をHugging Faceで公開しました。総パラメータ753B、活性パラメータ40B、コンテキスト長は最大1Mです。

背景

NVIDIAはGPUを含むチップやシステム、AI向けの計算基盤とソフトウェアを開発する企業です。GLMはZ.aiが開発するAIモデルのファミリーで、文章生成や推論、コード作成、ツールを使う処理を対象としています。NVFP4はNVIDIAがBlackwell向けに導入した、AI推論の量子化に使う低精度の浮動小数点形式で、小さな値のブロックとテンソル全体にそれぞれスケールを持たせます。

何が新しいか

基盤となるGLM-5.3は、推論・コーディング・エージェント用途に向けたMoEモデルです。GLM-5.2と同じ基盤モデルを使い、ポストトレーニングによる改善と、長いコンテキストを支えるIndexShareインデクサー付きのスパースアテンションを採用しています。ネットワークアーキテクチャはGlmMoeDsaForCausalLMです。

NVIDIAはこれをModel Optimizerで量子化しました。モデルバージョンはNVFP4 1.0で、量子化にはnvidia-modelopt v0.47.0を使っています。キャリブレーションデータセットにはcnn_dailymailが挙げられています。

NVIDIAは、本モデルを同社が所有・開発した主体ではなく、第三者の要件に基づいてこのアプリケーションおよびユースケース向けに構築したものだと明記しています。想定用途は、量子化済みモデルをそのままAIエージェントシステム、チャットボット、RAGシステムなどに組み込む開発者です。

試し方と要件

Hugging Faceのnvidia/GLM-5.3-NVFP4として配布される量子化済みモデルを使います。対応ランタイムエンジンはSGLang、対応マイクロアーキテクチャはNVIDIA Blackwell、推奨OSはLinuxです。入出力はいずれもテキスト(文字列)で、入力パラメータは1次元、コンテキスト長は最大1Mです。デプロイ地域はグローバルとされています。

ライセンス

ライセンス種別はNVIDIA Proprietaryで、ダウンロードにはNVIDIA Open Model Agreementが適用されます。元のGLM-5.3モデルはGLM-5.3 Licenseの下にあり、同ライセンスはリポジトリに同梱されます。NVIDIA Open Model AgreementはGLM-5.3 Licenseやその条件を変更・優先するものではないとされています。商用・非商用いずれの利用にも対応します。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内