Redisの作者は、DeepSeek V4 / V4.1 Flash、GLM 5.x、Qwen3.8 Flash Nextを高メモリのMac、CUDA、ROCmマシンでローカル推論するC製エンジン「DwarfStar 4(ds4)」を公開しました。M5 Max 128 GBでは、284BパラメータのDeepSeek V4 Flash(q2)が2,048トークン時に生成39.4 t/sで動作します。Hacker Newsでは82ポイント・14コメントを集めました。
DeepSeekは、言語モデルの重みを公開する杭州の深度求索のブランドです。GLMはZ.aiの、QwenはAlibaba CloudのAIモデルファミリーです。
何が新しいか
ds4は汎用GGUFランナーではありません。対応するモデルファミリーとレイアウトを少数に絞り、それぞれをエンドツーエンドで検証する、意図的に狭い構成のエンジンです。ライセンスはMITで、テキストモデルとビジョンモデルの両方を扱います。
- 非対称2ビット量子化: ルーティングされるMoE専門家を圧縮し、重要な共有経路の精度は維持します。この方式で、対応するrouted-MoEビルドを想定マシンに収めています。
- KVキャッシュのSSD永続化: レンダリング済みプロンプト接頭辞のSHA1をキーにして、KVキャッシュをSSDへ保存します。再起動後も、一致する接頭辞は再計算せずに再読み込みできます。
- 1エンジン・3インターフェース:
./ds4(チャット)、./ds4-server(ローカルAPI)、./ds4-agent(永続的なコーディングセッション)の3つが、同一のモデル状態とキャッシュを共有します。 - その他の機能: SSDストリーミング、テンソル並列、セッションバッチング、DSPARK + MTP、ビジョン入力に対応します。
ベンチマーク
上流のリファレンス値です。対象はDeepSeek V4 Flashのq2です。
| マシン | コンテキスト | Prefill t/s | Generation t/s |
|---|---|---|---|
| M5 Max 128 GB | 2,048 tok | 790.2 | 39.4 |
| M5 Max 128 GB | 65,536 tok | 398.5 | 27.6 |
| DGX Spark 128 GB | 2,048 tok | 825.8 | 18.1 |
| DGX Spark 128 GB | 65,536 tok | 823.0 | 13.8 |
M5 Max 128 GBで32Kコンテキストの場合の推定値は、生成34.4 t/s、prefill 557 t/sです。
対応環境と試し方
対応ハードウェアは、Apple Silicon Mac(Metal、64 GB以上でモデルによる)、NVIDIA DGX SparkまたはCUDA Linux、AMD Strix Halo/Framework DesktopなどのROCm環境です。ROCmは、AMDが提供するGPU計算向けのオープンなソフトウェア群です。
Apple Siliconでの動作目安は次のとおりです。
- ベースライン: V4 Flash Q2が128 GBで動作します。
- 128 GBで収まるモデル: GLM 5.3 Q2とQwen Q4も収まります。V4.1 Q2はSSDからストリーミングして動かします。
- V4.1 Q4: Mac Studio 512 GB、またはPROクラスの余裕が必要です。
読み込むのはプロジェクト専用のGGUFで、汎用のGGUFファイルは対象外です。手順は次のとおりです。
git clone https://github.com/antirez/ds4
cd ds4 && ./download_model.sh ds4f-q2
make # macOS · Metal
make cuda-spark # Linux · DGX Spark
./ds4
./ds4-server --ctx 100000
コーディングエージェントとの接続
ds4-serverは、OpenAI形式とAnthropic形式のAPIを提供します。エンドポイントは/v1/chat/completions、/v1/messages、/v1/responsesです。Codex CLI、Claude Code、OpenCode、Piは、ベースURLを指定するだけでローカルマシンに接続できます。

まだコメントはありません。