NVIDIAは、ZAIのネイティブマルチモーダルMoEモデルGLM-5.3-Flash(総パラメータ320B、活性18B)をNVFP4に量子化したnvidia/GLM-5.3-Flash-NVFP4をHugging Faceで09/09/2026に公開しました。パラメータ当たりのビット数を16から4に減らしています。
NVFP4は、NVIDIAがBlackwell向けに導入したAI推論の量子化用の低精度浮動小数点形式です。
何が新しいか
ベースモデルのzai-org/GLM-5.3-Flashは、推論・コーディング・エージェントタスク向けのMoEモデルです。原文によると、ハイブリッドのsparse/linear attentionとManifold-Constrained Hyper-Connections(mHC)を採用し、最大1Mのコンテキスト長に対応しています。入力はテキスト、画像、動画(MP4/WebM)で、出力はテキストです。アーキテクチャ名はGlm5NextForConditionalGenerationです。
NVIDIAはModel Optimizerで重みと活性値をNVFP4に量子化しました。量子化の対象は、transformerブロック内の疎なMoE共有エキスパートとdense MLPの線形演算子に限られます。キャリブレーションにはcnn_dailymailとNemotron-Post-Training-Dataset-v2を使っています。
仕様
| 項目 | 内容 |
|---|---|
| モデルバージョン | NVFP4 1.0 |
| 量子化ツール | nvidia-modelopt v0.47.0 |
| ビット数/パラメータ | 16 → 4 |
| 評価ベンチマーク | GPQA Diamond、SciCode、MMMU Pro、AA-LCR、IFBench、Terminal Bench 2.1 |
| テストハードウェア | NVIDIA Blackwell GB200 |
動作要件と利用条件
- 対応GPUマイクロアーキテクチャ: NVIDIA Blackwell
- ランタイム: vLLM、SGLang
- 推奨OS: Linux
- ライセンス: MIT(商用・非商用ともに利用可)
NVIDIAは用途として、AIエージェント、チャットボット、RAGシステムへのデプロイを挙げています。また、このモデルはNVIDIAが所有・開発したものではなく、第三者の要件に基づいて構築したものだとしています。

まだコメントはありません。