Redis作者のds4、DeepSeek V4 FlashをM5 Maxで39.4 t/s

Redisの作者は、DeepSeek V4 / V4.1 Flash、GLM 5.x、Qwen3.8 Flash Nextを高メモリのMac、CUDA、ROCmマシンでローカル推論するC製エンジン「DwarfStar 4(ds4)」を公開しました。M5 Max 128 GBでは、284BパラメータのDeepSeek V4 Flash(q2)が2,048トークン時に生成39.4 t/sで動作します。Hacker Newsでは82ポイント・14コメントを集めました。

DeepSeekは、言語モデルの重みを公開する杭州の深度求索のブランドです。GLMはZ.aiの、QwenはAlibaba CloudのAIモデルファミリーです。

何が新しいか

ds4は汎用GGUFランナーではありません。対応するモデルファミリーとレイアウトを少数に絞り、それぞれをエンドツーエンドで検証する、意図的に狭い構成のエンジンです。ライセンスはMITで、テキストモデルとビジョンモデルの両方を扱います。

  • 非対称2ビット量子化: ルーティングされるMoE専門家を圧縮し、重要な共有経路の精度は維持します。この方式で、対応するrouted-MoEビルドを想定マシンに収めています。
  • KVキャッシュのSSD永続化: レンダリング済みプロンプト接頭辞のSHA1をキーにして、KVキャッシュをSSDへ保存します。再起動後も、一致する接頭辞は再計算せずに再読み込みできます。
  • 1エンジン・3インターフェース: ./ds4(チャット)、./ds4-server(ローカルAPI)、./ds4-agent(永続的なコーディングセッション)の3つが、同一のモデル状態とキャッシュを共有します。
  • その他の機能: SSDストリーミング、テンソル並列、セッションバッチング、DSPARK + MTP、ビジョン入力に対応します。

ベンチマーク

上流のリファレンス値です。対象はDeepSeek V4 Flashのq2です。

マシン コンテキスト Prefill t/s Generation t/s
M5 Max 128 GB 2,048 tok 790.2 39.4
M5 Max 128 GB 65,536 tok 398.5 27.6
DGX Spark 128 GB 2,048 tok 825.8 18.1
DGX Spark 128 GB 65,536 tok 823.0 13.8

M5 Max 128 GBで32Kコンテキストの場合の推定値は、生成34.4 t/s、prefill 557 t/sです。

対応環境と試し方

対応ハードウェアは、Apple Silicon Mac(Metal、64 GB以上でモデルによる)、NVIDIA DGX SparkまたはCUDA Linux、AMD Strix Halo/Framework DesktopなどのROCm環境です。ROCmは、AMDが提供するGPU計算向けのオープンなソフトウェア群です。

Apple Siliconでの動作目安は次のとおりです。

  • ベースライン: V4 Flash Q2が128 GBで動作します。
  • 128 GBで収まるモデル: GLM 5.3 Q2とQwen Q4も収まります。V4.1 Q2はSSDからストリーミングして動かします。
  • V4.1 Q4: Mac Studio 512 GB、またはPROクラスの余裕が必要です。

読み込むのはプロジェクト専用のGGUFで、汎用のGGUFファイルは対象外です。手順は次のとおりです。

git clone https://github.com/antirez/ds4
cd ds4 && ./download_model.sh ds4f-q2
make              # macOS · Metal
make cuda-spark   # Linux · DGX Spark
./ds4
./ds4-server --ctx 100000

コーディングエージェントとの接続

ds4-serverは、OpenAI形式とAnthropic形式のAPIを提供します。エンドポイントは/v1/chat/completions、/v1/messages、/v1/responsesです。Codex CLI、Claude Code、OpenCode、Piは、ベースURLを指定するだけでローカルマシンに接続できます。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内