NVIDIA、GLM-5.3-FlashのNVFP4量子化版をBlackwell向けに公開

スペック

総パラメータ320B in total
活性パラメータ18B activated
コンテキスト長up to 1M
ライセンスMIT
配布形式・量子化NVFP4
4bit量子化の目安メモリ約192GB(256GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

NVIDIAは、ZAIのネイティブマルチモーダルMoEモデルGLM-5.3-Flash(総パラメータ320B、活性18B)をNVFP4に量子化したnvidia/GLM-5.3-Flash-NVFP4をHugging Faceで09/09/2026に公開しました。パラメータ当たりのビット数を16から4に減らしています。

NVFP4は、NVIDIAがBlackwell向けに導入したAI推論の量子化用の低精度浮動小数点形式です。

何が新しいか

ベースモデルのzai-org/GLM-5.3-Flashは、推論・コーディング・エージェントタスク向けのMoEモデルです。原文によると、ハイブリッドのsparse/linear attentionとManifold-Constrained Hyper-Connections(mHC)を採用し、最大1Mのコンテキスト長に対応しています。入力はテキスト、画像、動画(MP4/WebM)で、出力はテキストです。アーキテクチャ名はGlm5NextForConditionalGenerationです。

NVIDIAはModel Optimizerで重みと活性値をNVFP4に量子化しました。量子化の対象は、transformerブロック内の疎なMoE共有エキスパートとdense MLPの線形演算子に限られます。キャリブレーションにはcnn_dailymailとNemotron-Post-Training-Dataset-v2を使っています。

仕様

項目 内容
モデルバージョン NVFP4 1.0
量子化ツール nvidia-modelopt v0.47.0
ビット数/パラメータ 16 → 4
評価ベンチマーク GPQA Diamond、SciCode、MMMU Pro、AA-LCR、IFBench、Terminal Bench 2.1
テストハードウェア NVIDIA Blackwell GB200

動作要件と利用条件

  • 対応GPUマイクロアーキテクチャ: NVIDIA Blackwell
  • ランタイム: vLLM、SGLang
  • 推奨OS: Linux
  • ライセンス: MIT(商用・非商用ともに利用可)

NVIDIAは用途として、AIエージェント、チャットボット、RAGシステムへのデプロイを挙げています。また、このモデルはNVIDIAが所有・開発したものではなく、第三者の要件に基づいて構築したものだとしています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内