InferactとvLLMチームは、DeepSeek-V4.1-Flashの公開から3週間でvLLM上の推論を最適化し、day-0実装比で低同時実行時の速度を1.9倍、150 TPS制約下のスループットを5.3倍に引き上げました。SemiAnalysis AgentXの高スループット構成では約5倍の向上です。
vLLMは大規模言語モデルの推論とAPI配信のためのライブラリで、DeepSeekは言語モデルの研究成果と重みを公開するAI開発企業です。
何が新しいか
vLLMは、SWA bounded replay、CUDA graphs、DeepSeekが公開したMegaAttention・Mega-mHC・Mega-Gate・DeepSelectなどのカーネル統合、残りのカーネルの融合・並列化を組み合わせました。DeepSeek-V4.1-Flashは因果エンコーダー・デコーダー(CED)構成で、デコード時に1トークンあたり16B、プリフィル時に8Bのパラメータを活性化します。CSA2、FP4 KV cache、層間KV cache共有により、グローバルKVは1トークンあたり約890 bytesです。
SWA bounded replay
SWA KVは各40層で直近128位置をFP8で保持します。厳密に再計算すると約L×128トークンの再実行が必要になるため、bounded replayは直近128トークンだけを再実行し、SWAウィンドウをreplay開始位置で切り詰めます。
- エンコーダー側: グローバルKVだけをキャッシュし、長さHのprefixヒット時にトークン
[H − 128, H)を再実行してSWA KVを再構築します。 - デコーダー側: layer 20を全トークンで実行し、layers 21–39は各リクエストの最後の128トークンだけで実行します。長いプロンプトではモデルのほぼ半分を省略できます。
- CUDA graphs: layers 0–20をフルバッチで、layers 21–39をトリミング済みバッチで別々にキャプチャします。
結果はbit-exactではありませんが、vLLMの検証ではGSM8KとGPQAで意味のある精度差はなく、差は約1.5標準誤差以内でした。デコーダーCUDA graphs併用でプリフィル計算時間を30–40%削減し、TTFTを約30%短縮しています。CUDA graphsなしでは短いプロンプトでベースラインより遅くなる場合があります(DEP2の1Kで最大+12%)。
使い方
SWA bounded replayはDeepSeek-V4.1向けにデフォルトで有効です。--[no-]swa-bounded-replayで有効・無効を切り替えます。
カーネル最適化の数値
| 項目 | 効果 |
|---|---|
Mega-mHC(#56962) |
TileLang版比1.14–1.51倍(GB200) |
Mega-Gate(#56266) |
中程度のバッチで1.18–1.31倍 |
mHCマルチストリーム重複(#57603) |
TP4低遅延でレイテンシ約4%削減 |
Sparse MQA logits(#56254)、GB300 1層 |
8Kで1.2倍、512Kで14–23倍 |
| Sparse MQA logits、4× GB300 E2E | デコード3–6%改善、512Kプリフィル1.43倍、1Mで2倍 |
MegaAttention(#56935) |
NVFP4 KVはFP8比45%小、カーネル効率1.45倍 |
低遅延fused WO-A(#58634) |
最大約2.1倍、低同時実行でITL最大約6–7%減 |
Engram THP対応(#56926) |
プリフィルのlookupカーネル最大10倍 |
NVFP4はNVIDIAがBlackwell向けに導入した低精度浮動小数点形式です。
AgentXでの構成
低遅延構成はTP4とFlashInfer attentionです。MegaAttentionも試しましたが、TP4ではFlashInferの方が速い結果でした。高スループット構成はDEP2で、DP attentionを使いexpertをGPU間で分割します。V4.1は全ヘッドで共有KV latentを使うため、TPではKV cacheがGPU間で重複しますが、DPでは各GPUが担当リクエストのKVだけを保持します。ベンチマーク全体でKV cache offloadingは不要でした。約100Kスループット付近では、3つの最適化の組み合わせでTTFTが約70%低下しています。

まだコメントはありません。