NVIDIAは、DeepSeek AIのDeepSeek-V4.1-FlashをNVFP4で量子化したnvidia/DeepSeek-V4.1-Flash-NVFP4をHugging Faceで公開しました(Release Date: Hugging Face 09/16/2026)。552Bバックボーン、prefill時8B・decode時16Bの活性パラメータ、最大1M tokensのコンテキスト長を持ち、ライセンスはMITです。
NVFP4はNVIDIAがBlackwell向けに導入した低精度の浮動小数点形式で、BlackwellのTensorコアがこの形式のデータ処理を支援します。
モデル構成
元モデルのDeepSeek-V4.1-Flashは、ネイティブマルチモーダルのMixture-of-Expertsで、Causal Encoder-Decoder(CED)アーキテクチャとCompressed Sparse Attention 2(CSA2)を採用します。ネットワークアーキテクチャはDeepseekV41ForCausalLMです。パラメータは552B backbone in totalで、prefillで8B、decodeで16Bが活性化し、これに加えて196BのEngram conditional memoryを持ちます。
入力はテキストと画像(String、RGB、1Dおよび2D)で、コンテキスト長は最大1M tokens、出力はテキスト(String、1Dシーケンス)です。
量子化とバージョン
量子化にはNVIDIA Model Optimizerを使用し、nvidia-modelopt v0.47.0rc0 とV4.1向けの互換性変更を適用しています。ソースリビジョンはdba1be0a40aa45a94ad051997016db3960a90277です。キャリブレーションデータセットはcnn_dailymailです。
動作環境と検証状況
| 項目 | 内容 |
|---|---|
| 対応ランタイム | vLLM、SGLang |
| 対応マイクロアーキテクチャ | NVIDIA Blackwell |
| 推奨OS | Linux |
| 検証環境 | GB300 |
NVIDIAは両ランタイムをGB300上でこのNVFP4チェックポイントとともにテストしており、モデルカードのベンチマーク結果はvLLMで取得したとしています。SGLangについては、ロード、生成、推論・ツール呼び出しの解析、画像入力のスモークテストで検証したとしています。商用・非商用のいずれでも利用でき、Deployment GeographyはGlobalです。
想定用途と位置づけ
NVIDIAは用途として、AIエージェントシステム、チャットボット、RAGシステムなどへ、あらかじめ量子化済みのモデルをそのまま展開したい開発者を挙げています。同時に、このモデルはNVIDIAが所有・開発したものではなく、第三者の要件に基づいてこの用途向けに開発・構築されたものであるとして、DeepSeek AIによる元モデルのモデルカードを参照するよう記載しています。また、基盤モデルやファインチューン済みモデルをAIシステムへ統合する際は、V-modelの方法論に沿ってユニットレベルとシステムレベルで反復的なテストと検証を行う必要があるとしています。

まだコメントはありません。