NVIDIA、DeepSeek-V4-Pro-0813のDSparkドラフトヘッドもNVFP4化した1.65Tモデルを公開

スペック

総パラメータ1.65T
活性パラメータ49B
コンテキスト長1 million tokens
ライセンスMIT
配布形式・量子化NVFP4
4bit量子化の目安メモリ約990GB(単体のマシンでは難しい規模)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

NVIDIAは2026年9月9日、Hugging Faceでnvidia/DeepSeek-V4-Pro-0813-nvfp4-DSparkを公開しました。総パラメータ1.65T・活性パラメータ49BのMoEであるDeepSeek AIのDeepSeek-V4-Pro-0813を、DSparkドラフトヘッドまで含めてNVFP4に量子化した版です。

既存のNVFP4版との差分

原文はこのモデルを「新しいモデルではない」と明記しており、nvidia/DeepSeek-V4-Pro-0813-NVFP4の派生版として位置づけています。従来のNVFP4リリースはDSparkのドラフトヘッドをソースのMXFP4形式のまま残しており、1つのチェックポイント内でターゲットとドラフトが異なるエキスパート形式を持っていました。今回の版はドラフトエキスパートをNVFP4へロスレスにキャストし、単一の自己整合的なチェックポイントがターゲットモデルとドラフトモデルの両方を兼ねる構成にしています。バックボーン重みはNVFP4版とビット単位で同一です。量子化にはNVIDIA Model Optimizerを使用しています。

ベースのDeepSeek-V4-Pro-0813は、ハイブリッド注意機構(Compressed Sparse AttentionとHeavily Compressed Attention)とManifold-Constrained Hyper-Connectionsを採用した自己回帰型MoE言語モデルで、ネットワークアーキテクチャはDeepseekV4ForCausalLMです。DSpark投機デコードモジュールを同一チェックポイントに含む、DeepSeek-V4-Proの公式リリースだと説明されています。

実行要件と試し方

項目 内容
対応ハードウェア NVIDIA Blackwell B200
対応ランタイムエンジン SGLang、vLLM
推奨OS Linux
利用可能地域 Global
ライセンス MIT
利用形態 商用・非商用ともに可

入力はテキスト(文字列、1次元シーケンス)で、システムプロンプト・ユーザーメッセージ・アシスタント応答からなるマルチターン会話に対応します。最大コンテキスト長は1 million tokensです。入力にはカスタムエンコーディングパイプラインencoding_dsv4を使い、推論努力レベルとしてlow、high、maxを指定できます。出力側は構造化JSON出力、function/tool calling、有効化時の推論コンテンツに対応します。

想定用途

原文は、DeepSeek V4の適合用途として高度な推論、エージェント型AIアプリケーション、ツール利用、そして数学・ソフトウェア工学・企業向けAIアシスタントといった領域での複雑な問題解決を挙げています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内