AMDは2026年9月25日、AMD Quarkを使ってMoEモデルQwen3.6-35B-A3BをAMD Strix Halo上でW4A16へローカル量子化し、llama.cppとvLLMの両バックエンドへ展開するワークフローを公開しました。量子化により重みは約70 GBから約21 GBへ縮小します。執筆はHongWei Meng、Wei Luo、Xinjun Niu、Lin Zhao、Spandan Tiwariの5氏です。
何が新しいか
記事は、ローカルAIの展開では対象デバイス上での推論だけでなく、量子化とエクスポートによるモデル準備も必要な工程だと位置づけています。AMD Quark、llama.cpp、vLLMをいずれも同じStrix Haloシステム上で使い、量子化・エクスポート・バックエンドレベルの検証・Lemonadeによるアプリケーションレベルの展開までを一連の流れとして扱っています。
検証モデルのQwen3.6-35B-A3Bは言語モデルパラメータ35B、トークン当たりの活性パラメータが約3BのMoEモデルで、そのサイズとMoE構成がStrix Halo上のローカル量子化と展開を評価する代表的なワークロードだとしています。配布・展開形式はGGUFとsafetensorsです。
数値と条件
| 項目 | 値 |
|---|---|
| 量子化前の重みサイズ | roughly 70 GB |
| 量子化後の重みサイズ | about 21 GB |
| 総言語モデルパラメータ | 35B |
| トークン当たり活性パラメータ | approximately 3B |
| 量子化方式 | W4A16 weight-only |
| システムメモリ | 128 GB unified |
llama.cpp向けの展開形式はGGUF、vLLM向けはQuarkの量子化メタデータ付きsafetensorsです。アプリケーションレベルの確認では、Lemonadeがllama.cpp backend経由で同じGGUF artifactを使用します。
実験はASUS ROG Flow Z13(2025)上で行われており、持続負荷時には熱および電力の制限がスループットに影響し得るため、性能測定は個別のデバイス構成を踏まえて解釈する必要があると記事は述べています。
試し方と要件
必要なものは、AMD Strix Haloシステムと対応するROCm環境、そして再現したい展開パスに応じたAMD Quarkと推論ランタイムです。Lemonadeのデモを再現する場合はLemonadeも用意します。
- AMD Quarkで、選択したモデル層にW4A16のweight-only量子化を適用し、選択したコンポーネントを高精度のまま保持した量子化チェックポイントを生成します。
- llama.cpp向けにはGGUF、vLLM向けにはQuark量子化メタデータ付きの
safetensorsへエクスポートします。 - エクスポート済みモデルをllama.cppまたはvLLMで読み込み、バックエンドレベルの推論と評価を行います。
- アプリケーションレベルの展開を再現する場合は、Lemonadeでllama.cpp backend経由にQuarkがエクスポートしたGGUFモデルを読み込みます。
背景
llama.cppはggml-orgが公開するC/C++実装の推論ソフトウェアで、CPUや各社GPUで動作し、量子化とCPU・GPU併用に対応します。GGUFはGGMLプロジェクトが仕様を公開する推論用モデルのバイナリ形式で、テンソルと読み込みに必要なメタデータを格納します。vLLMはPagedAttentionによるメモリ管理や連続バッチ処理を備えた推論・API配信ライブラリで、OpenAI互換APIからモデルを利用できます。

まだコメントはありません。