Strata、125BのQwen3.8-Flash-NextをRTX 5070で94 tokens/s

スペック

総パラメータ125B
コンテキスト長128K context
配布形式・量子化Q2_0、IQ2_XS、IQ3_XXS、IQ3_S、Coder、Unsloth UD-IQ4_XS、UD-Q4_K_XL
4bit量子化の目安メモリ約75GB(96GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

Strataは、総パラメータ125BのQwen3.8-Flash-Nextを、VRAM 12GB以上のNVIDIAまたはAMD GPUを積んだWindows/LinuxのコンシューマーPCで実行できる推論エンジン兼アプリです。RTX 5070(12GB)ではQ2_0で生成94 tokens/s、32Kトークン入力の処理で2,650 tokens/sを計測しています。

QwenはAlibaba Cloudが開発する大規模言語モデルのファミリーで、重みを公開し、密な構造と専門家混合型のモデルを提供しています。

仕組み

Strataによると、このモデルは通常数百GBのGPUメモリを持つサーバーで動かすものです。Qwen3.8-Flash-Nextは24,576個のエキスパートで構成され、1トークンあたり10個だけを使います。Strataは使用頻度の高い数千個のエキスパートをGPUに置き、全エキスパートをRAMに保持してCPUが残りを並行処理し、SSDには大きなルックアップテーブルを置きます。小さな補助モデルが次の数語を推測し本体がまとめて検証する方式で、同じ出力を1.6〜1.8倍速く返します。長文は最大8,192トークン単位で読み込みます。ローカル実行のためデータはPC外へ出ず、チャット、コード生成、画像入力、アプリやコーディングエージェントとの接続に対応します。コンテキスト長は128Kです。

計測結果

計測環境はNVIDIAがRTX 5070(12GB)・Ryzen 5 7600・RAM 64GB、AMDがRX 9070 XT(16GB)・Ryzen 9 3900X・RAM 47GBです(4K出力、32Kプロンプト)。

GPU 形式 生成 入力処理
RTX 5070 Q2_0 94 tokens/s 2,650 tokens/s
RTX 5070 IQ2_XS 79 tokens/s 2,090 tokens/s
RTX 5070 IQ3_XXS 62 tokens/s 1,750 tokens/s
RTX 5070 IQ3_S 53 tokens/s 1,620 tokens/s
RTX 5070 Coder 55 tokens/s 2,180 tokens/s
RX 9070 XT Q2_0 60 tokens/s 1,160 tokens/s
RX 9070 XT IQ2_XS 52 tokens/s 1,110 tokens/s
RX 9070 XT Coder 44 tokens/s 1,420 tokens/s

NVIDIAのQ2_0はエンジン0.1.36、それ以外は0.1.26での計測です。StrataはRTX 3090(24GB)なら生成100〜140 tokens/sになると見込んでいます。Unsloth UD-Q4_K_XL(実験的)は大半をSSDから読むため、64GB機で7〜8.5 tokens/sにとどまります。

要件とモデル選択

項目 条件
NVIDIA GeForce RTX 20/30/40/50シリーズ
AMD RX 7900 XT/XTX、RX 7800 XT/7700 XT、RX 9060 XT、RX 9070/9070 XT、Radeon AI PRO R9700、RX 6800/6900シリーズ
VRAM 12GB以上
RAM 32GB以上(64GBで全サイズ動作)
ディスク 空き約80GB、SSD推奨
OS Windows 10/11またはLinux

2〜3枚のGPUでモデルを分担できます。AMDの画像入力はLinuxではCPU経由で動き、Windowsでは未対応です。

インストーラーはRAM量に応じて推奨します。32GBはCoder、48GBはIQ2_XS(最速はQ2_0)、64GBはIQ2_XS推奨でIQ3_XXS/IQ3_Sも可、96GB以上はIQ3_SかUnslothのUD-IQ4_XS(約4bit、94GBダウンロード)です。Coderはエキスパートの半分を削ったコーディング版で、作者計測でフルモデルのSWE-bench Verifiedスコアの91%に達しますが、コード以外や日本語を含むCJKテキストでは弱くなります。Swift 1.5は思考時間を短くしたファインチューンです。圧縮はISTA-DASLab、UkisAI(Swift 1.5)、Unslothが担当しています。

試し方

  1. Strataをダウンロードして解凍するかgit cloneします。
  2. WindowsはSTART-HERE.batをダブルクリック、LinuxはStrataフォルダーで./setup.shを実行します。
  3. モデル、サイズ、コンテキスト長、画像読み取りの有無を選びます。Enterで推奨値になります。モデルのダウンロードは約70GBで、中断しても再実行で続きから再開します。
  4. ブラウザーでhttp://127.0.0.1:8080を開きます。起動時はRAMに35〜55GBを読み込み、1〜3分PCの応答が止まることがあります。

OpenAI互換クライアントはベースURLhttp://127.0.0.1:8080/v1(APIキーとモデル名は任意)、Anthropic API利用アプリは/v1/messages、Claude CodeはANTHROPIC_BASE_URL=http://127.0.0.1:8080、Codex CLIなどResponses API利用アプリは/v1/responsesを使います。既定では同時に1リクエストだけ処理し、"parallel": 2で並列化できますが、12GBカードでは各応答が遅くなります。StrataはMITライセンスで、llama.cpp/ggmlの一部を使用しています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内