AMD Quark、Strix HaloでQwen3.6-35B-A3Bを70GBから21GBへ量子化

スペック

総パラメータ35B
活性パラメータapproximately 3B
配布形式・量子化W4A16; 配布・展開形式はGGUF、safetensors
4bit量子化の目安メモリ約21GB(24GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

AMDは2026年9月25日、AMD Quarkを使ってMoEモデルQwen3.6-35B-A3BをAMD Strix Halo上でW4A16へローカル量子化し、llama.cppとvLLMの両バックエンドへ展開するワークフローを公開しました。量子化により重みは約70 GBから約21 GBへ縮小します。執筆はHongWei Meng、Wei Luo、Xinjun Niu、Lin Zhao、Spandan Tiwariの5氏です。

何が新しいか

記事は、ローカルAIの展開では対象デバイス上での推論だけでなく、量子化とエクスポートによるモデル準備も必要な工程だと位置づけています。AMD Quark、llama.cpp、vLLMをいずれも同じStrix Haloシステム上で使い、量子化・エクスポート・バックエンドレベルの検証・Lemonadeによるアプリケーションレベルの展開までを一連の流れとして扱っています。

検証モデルのQwen3.6-35B-A3Bは言語モデルパラメータ35B、トークン当たりの活性パラメータが約3BのMoEモデルで、そのサイズとMoE構成がStrix Halo上のローカル量子化と展開を評価する代表的なワークロードだとしています。配布・展開形式はGGUFとsafetensorsです。

数値と条件

項目 値
量子化前の重みサイズ roughly 70 GB
量子化後の重みサイズ about 21 GB
総言語モデルパラメータ 35B
トークン当たり活性パラメータ approximately 3B
量子化方式 W4A16 weight-only
システムメモリ 128 GB unified

llama.cpp向けの展開形式はGGUF、vLLM向けはQuarkの量子化メタデータ付きsafetensorsです。アプリケーションレベルの確認では、Lemonadeがllama.cpp backend経由で同じGGUF artifactを使用します。

実験はASUS ROG Flow Z13(2025)上で行われており、持続負荷時には熱および電力の制限がスループットに影響し得るため、性能測定は個別のデバイス構成を踏まえて解釈する必要があると記事は述べています。

試し方と要件

必要なものは、AMD Strix Haloシステムと対応するROCm環境、そして再現したい展開パスに応じたAMD Quarkと推論ランタイムです。Lemonadeのデモを再現する場合はLemonadeも用意します。

  1. AMD Quarkで、選択したモデル層にW4A16のweight-only量子化を適用し、選択したコンポーネントを高精度のまま保持した量子化チェックポイントを生成します。
  2. llama.cpp向けにはGGUF、vLLM向けにはQuark量子化メタデータ付きのsafetensorsへエクスポートします。
  3. エクスポート済みモデルをllama.cppまたはvLLMで読み込み、バックエンドレベルの推論と評価を行います。
  4. アプリケーションレベルの展開を再現する場合は、Lemonadeでllama.cpp backend経由にQuarkがエクスポートしたGGUFモデルを読み込みます。

背景

llama.cppはggml-orgが公開するC/C++実装の推論ソフトウェアで、CPUや各社GPUで動作し、量子化とCPU・GPU併用に対応します。GGUFはGGMLプロジェクトが仕様を公開する推論用モデルのバイナリ形式で、テンソルと読み込みに必要なメタデータを格納します。vLLMはPagedAttentionによるメモリ管理や連続バッチ処理を備えた推論・API配信ライブラリで、OpenAI互換APIからモデルを利用できます。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内