NVIDIA、DeepSeek-V4.1-FlashのNVFP4量子化版を公開 552Bで1Mコンテキスト

スペック

総パラメータ552B backbone in total
活性パラメータ8B activated during prefill and 16B during decode
コンテキスト長up to one million tokens
ライセンスMIT
重みの公開NVFP4で量子化されたモデル
配布形式・量子化NVFP4
4bit量子化の目安メモリ約331.2GB(512GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

NVIDIAは、DeepSeek AIのDeepSeek-V4.1-FlashをNVFP4で量子化したnvidia/DeepSeek-V4.1-Flash-NVFP4をHugging Faceで公開しました(Release Date: Hugging Face 09/16/2026)。552Bバックボーン、prefill時8B・decode時16Bの活性パラメータ、最大1M tokensのコンテキスト長を持ち、ライセンスはMITです。

NVFP4はNVIDIAがBlackwell向けに導入した低精度の浮動小数点形式で、BlackwellのTensorコアがこの形式のデータ処理を支援します。

モデル構成

元モデルのDeepSeek-V4.1-Flashは、ネイティブマルチモーダルのMixture-of-Expertsで、Causal Encoder-Decoder(CED)アーキテクチャとCompressed Sparse Attention 2(CSA2)を採用します。ネットワークアーキテクチャはDeepseekV41ForCausalLMです。パラメータは552B backbone in totalで、prefillで8B、decodeで16Bが活性化し、これに加えて196BのEngram conditional memoryを持ちます。

入力はテキストと画像(String、RGB、1Dおよび2D)で、コンテキスト長は最大1M tokens、出力はテキスト(String、1Dシーケンス)です。

量子化とバージョン

量子化にはNVIDIA Model Optimizerを使用し、nvidia-modelopt v0.47.0rc0 とV4.1向けの互換性変更を適用しています。ソースリビジョンはdba1be0a40aa45a94ad051997016db3960a90277です。キャリブレーションデータセットはcnn_dailymailです。

動作環境と検証状況

項目 内容
対応ランタイム vLLM、SGLang
対応マイクロアーキテクチャ NVIDIA Blackwell
推奨OS Linux
検証環境 GB300

NVIDIAは両ランタイムをGB300上でこのNVFP4チェックポイントとともにテストしており、モデルカードのベンチマーク結果はvLLMで取得したとしています。SGLangについては、ロード、生成、推論・ツール呼び出しの解析、画像入力のスモークテストで検証したとしています。商用・非商用のいずれでも利用でき、Deployment GeographyはGlobalです。

想定用途と位置づけ

NVIDIAは用途として、AIエージェントシステム、チャットボット、RAGシステムなどへ、あらかじめ量子化済みのモデルをそのまま展開したい開発者を挙げています。同時に、このモデルはNVIDIAが所有・開発したものではなく、第三者の要件に基づいてこの用途向けに開発・構築されたものであるとして、DeepSeek AIによる元モデルのモデルカードを参照するよう記載しています。また、基盤モデルやファインチューン済みモデルをAIシステムへ統合する際は、V-modelの方法論に沿ってユニットレベルとシステムレベルで反復的なテストと検証を行う必要があるとしています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内