Strataは、総パラメータ125BのQwen3.8-Flash-Nextを、VRAM 12GB以上のNVIDIAまたはAMD GPUを積んだWindows/LinuxのコンシューマーPCで実行できる推論エンジン兼アプリです。RTX 5070(12GB)ではQ2_0で生成94 tokens/s、32Kトークン入力の処理で2,650 tokens/sを計測しています。
QwenはAlibaba Cloudが開発する大規模言語モデルのファミリーで、重みを公開し、密な構造と専門家混合型のモデルを提供しています。
仕組み
Strataによると、このモデルは通常数百GBのGPUメモリを持つサーバーで動かすものです。Qwen3.8-Flash-Nextは24,576個のエキスパートで構成され、1トークンあたり10個だけを使います。Strataは使用頻度の高い数千個のエキスパートをGPUに置き、全エキスパートをRAMに保持してCPUが残りを並行処理し、SSDには大きなルックアップテーブルを置きます。小さな補助モデルが次の数語を推測し本体がまとめて検証する方式で、同じ出力を1.6〜1.8倍速く返します。長文は最大8,192トークン単位で読み込みます。ローカル実行のためデータはPC外へ出ず、チャット、コード生成、画像入力、アプリやコーディングエージェントとの接続に対応します。コンテキスト長は128Kです。
計測結果
計測環境はNVIDIAがRTX 5070(12GB)・Ryzen 5 7600・RAM 64GB、AMDがRX 9070 XT(16GB)・Ryzen 9 3900X・RAM 47GBです(4K出力、32Kプロンプト)。
| GPU | 形式 | 生成 | 入力処理 |
|---|---|---|---|
| RTX 5070 | Q2_0 | 94 tokens/s | 2,650 tokens/s |
| RTX 5070 | IQ2_XS | 79 tokens/s | 2,090 tokens/s |
| RTX 5070 | IQ3_XXS | 62 tokens/s | 1,750 tokens/s |
| RTX 5070 | IQ3_S | 53 tokens/s | 1,620 tokens/s |
| RTX 5070 | Coder | 55 tokens/s | 2,180 tokens/s |
| RX 9070 XT | Q2_0 | 60 tokens/s | 1,160 tokens/s |
| RX 9070 XT | IQ2_XS | 52 tokens/s | 1,110 tokens/s |
| RX 9070 XT | Coder | 44 tokens/s | 1,420 tokens/s |
NVIDIAのQ2_0はエンジン0.1.36、それ以外は0.1.26での計測です。StrataはRTX 3090(24GB)なら生成100〜140 tokens/sになると見込んでいます。Unsloth UD-Q4_K_XL(実験的)は大半をSSDから読むため、64GB機で7〜8.5 tokens/sにとどまります。
要件とモデル選択
| 項目 | 条件 |
|---|---|
| NVIDIA | GeForce RTX 20/30/40/50シリーズ |
| AMD | RX 7900 XT/XTX、RX 7800 XT/7700 XT、RX 9060 XT、RX 9070/9070 XT、Radeon AI PRO R9700、RX 6800/6900シリーズ |
| VRAM | 12GB以上 |
| RAM | 32GB以上(64GBで全サイズ動作) |
| ディスク | 空き約80GB、SSD推奨 |
| OS | Windows 10/11またはLinux |
2〜3枚のGPUでモデルを分担できます。AMDの画像入力はLinuxではCPU経由で動き、Windowsでは未対応です。
インストーラーはRAM量に応じて推奨します。32GBはCoder、48GBはIQ2_XS(最速はQ2_0)、64GBはIQ2_XS推奨でIQ3_XXS/IQ3_Sも可、96GB以上はIQ3_SかUnslothのUD-IQ4_XS(約4bit、94GBダウンロード)です。Coderはエキスパートの半分を削ったコーディング版で、作者計測でフルモデルのSWE-bench Verifiedスコアの91%に達しますが、コード以外や日本語を含むCJKテキストでは弱くなります。Swift 1.5は思考時間を短くしたファインチューンです。圧縮はISTA-DASLab、UkisAI(Swift 1.5)、Unslothが担当しています。
試し方
- Strataをダウンロードして解凍するか
git cloneします。 - Windowsは
START-HERE.batをダブルクリック、LinuxはStrataフォルダーで./setup.shを実行します。 - モデル、サイズ、コンテキスト長、画像読み取りの有無を選びます。Enterで推奨値になります。モデルのダウンロードは約70GBで、中断しても再実行で続きから再開します。
- ブラウザーで
http://127.0.0.1:8080を開きます。起動時はRAMに35〜55GBを読み込み、1〜3分PCの応答が止まることがあります。
OpenAI互換クライアントはベースURLhttp://127.0.0.1:8080/v1(APIキーとモデル名は任意)、Anthropic API利用アプリは/v1/messages、Claude CodeはANTHROPIC_BASE_URL=http://127.0.0.1:8080、Codex CLIなどResponses API利用アプリは/v1/responsesを使います。既定では同時に1リクエストだけ処理し、"parallel": 2で並列化できますが、12GBカードでは各応答が遅くなります。StrataはMITライセンスで、llama.cpp/ggmlの一部を使用しています。

まだコメントはありません。