vLLM、DeepSeek-V4.1-Flashのスループットを3週間で最大5.3倍に

スペック

活性パラメータ16B(decode時)、8B(prefill時)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

InferactとvLLMチームは、DeepSeek-V4.1-Flashの公開から3週間でvLLM上の推論を最適化し、day-0実装比で低同時実行時の速度を1.9倍、150 TPS制約下のスループットを5.3倍に引き上げました。SemiAnalysis AgentXの高スループット構成では約5倍の向上です。

vLLMは大規模言語モデルの推論とAPI配信のためのライブラリで、DeepSeekは言語モデルの研究成果と重みを公開するAI開発企業です。

何が新しいか

vLLMは、SWA bounded replay、CUDA graphs、DeepSeekが公開したMegaAttention・Mega-mHC・Mega-Gate・DeepSelectなどのカーネル統合、残りのカーネルの融合・並列化を組み合わせました。DeepSeek-V4.1-Flashは因果エンコーダー・デコーダー(CED)構成で、デコード時に1トークンあたり16B、プリフィル時に8Bのパラメータを活性化します。CSA2、FP4 KV cache、層間KV cache共有により、グローバルKVは1トークンあたり約890 bytesです。

SWA bounded replay

SWA KVは各40層で直近128位置をFP8で保持します。厳密に再計算すると約L×128トークンの再実行が必要になるため、bounded replayは直近128トークンだけを再実行し、SWAウィンドウをreplay開始位置で切り詰めます。

  • エンコーダー側: グローバルKVだけをキャッシュし、長さHのprefixヒット時にトークン[H − 128, H)を再実行してSWA KVを再構築します。
  • デコーダー側: layer 20を全トークンで実行し、layers 21–39は各リクエストの最後の128トークンだけで実行します。長いプロンプトではモデルのほぼ半分を省略できます。
  • CUDA graphs: layers 0–20をフルバッチで、layers 21–39をトリミング済みバッチで別々にキャプチャします。

結果はbit-exactではありませんが、vLLMの検証ではGSM8KとGPQAで意味のある精度差はなく、差は約1.5標準誤差以内でした。デコーダーCUDA graphs併用でプリフィル計算時間を30–40%削減し、TTFTを約30%短縮しています。CUDA graphsなしでは短いプロンプトでベースラインより遅くなる場合があります(DEP2の1Kで最大+12%)。

使い方

SWA bounded replayはDeepSeek-V4.1向けにデフォルトで有効です。--[no-]swa-bounded-replayで有効・無効を切り替えます。

カーネル最適化の数値

項目 効果
Mega-mHC(#56962) TileLang版比1.14–1.51倍(GB200)
Mega-Gate(#56266) 中程度のバッチで1.18–1.31倍
mHCマルチストリーム重複(#57603) TP4低遅延でレイテンシ約4%削減
Sparse MQA logits(#56254)、GB300 1層 8Kで1.2倍、512Kで14–23倍
Sparse MQA logits、4× GB300 E2E デコード3–6%改善、512Kプリフィル1.43倍、1Mで2倍
MegaAttention(#56935) NVFP4 KVはFP8比45%小、カーネル効率1.45倍
低遅延fused WO-A(#58634) 最大約2.1倍、低同時実行でITL最大約6–7%減
Engram THP対応(#56926) プリフィルのlookupカーネル最大10倍

NVFP4はNVIDIAがBlackwell向けに導入した低精度浮動小数点形式です。

AgentXでの構成

低遅延構成はTP4とFlashInfer attentionです。MegaAttentionも試しましたが、TP4ではFlashInferの方が速い結果でした。高スループット構成はDEP2で、DP attentionを使いexpertをGPU間で分割します。V4.1は全ヘッドで共有KV latentを使うため、TPではKV cacheがGPU間で重複しますが、DPでは各GPUが担当リクエストのKVだけを保持します。ベンチマーク全体でKV cache offloadingは不要でした。約100Kスループット付近では、3つの最適化の組み合わせでTTFTが約70%低下しています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内