NVIDIAは2026年9月9日、Hugging Faceでnvidia/DeepSeek-V4-Pro-0813-nvfp4-DSparkを公開しました。総パラメータ1.65T・活性パラメータ49BのMoEであるDeepSeek AIのDeepSeek-V4-Pro-0813を、DSparkドラフトヘッドまで含めてNVFP4に量子化した版です。
既存のNVFP4版との差分
原文はこのモデルを「新しいモデルではない」と明記しており、nvidia/DeepSeek-V4-Pro-0813-NVFP4の派生版として位置づけています。従来のNVFP4リリースはDSparkのドラフトヘッドをソースのMXFP4形式のまま残しており、1つのチェックポイント内でターゲットとドラフトが異なるエキスパート形式を持っていました。今回の版はドラフトエキスパートをNVFP4へロスレスにキャストし、単一の自己整合的なチェックポイントがターゲットモデルとドラフトモデルの両方を兼ねる構成にしています。バックボーン重みはNVFP4版とビット単位で同一です。量子化にはNVIDIA Model Optimizerを使用しています。
ベースのDeepSeek-V4-Pro-0813は、ハイブリッド注意機構(Compressed Sparse AttentionとHeavily Compressed Attention)とManifold-Constrained Hyper-Connectionsを採用した自己回帰型MoE言語モデルで、ネットワークアーキテクチャはDeepseekV4ForCausalLMです。DSpark投機デコードモジュールを同一チェックポイントに含む、DeepSeek-V4-Proの公式リリースだと説明されています。
実行要件と試し方
| 項目 | 内容 |
|---|---|
| 対応ハードウェア | NVIDIA Blackwell B200 |
| 対応ランタイムエンジン | SGLang、vLLM |
| 推奨OS | Linux |
| 利用可能地域 | Global |
| ライセンス | MIT |
| 利用形態 | 商用・非商用ともに可 |
入力はテキスト(文字列、1次元シーケンス)で、システムプロンプト・ユーザーメッセージ・アシスタント応答からなるマルチターン会話に対応します。最大コンテキスト長は1 million tokensです。入力にはカスタムエンコーディングパイプラインencoding_dsv4を使い、推論努力レベルとしてlow、high、maxを指定できます。出力側は構造化JSON出力、function/tool calling、有効化時の推論コンテンツに対応します。
想定用途
原文は、DeepSeek V4の適合用途として高度な推論、エージェント型AIアプリケーション、ツール利用、そして数学・ソフトウェア工学・企業向けAIアシスタントといった領域での複雑な問題解決を挙げています。

まだコメントはありません。