UnslothはHugging Faceで、Qwen-Image-2.1-Turboのtransformerを量子化したFP8版とINT8版を公開しました。14.2 GBのbf16 transformerを7.12〜7.26 GBに置き換え、推奨ファイルのINT8-ConvRotはbf16比のLPIPSが0.037です。
UnslothはAIモデルの実行・学習のためのツール群を開発するチームで、量子化形式への出力にも対応しています。
何が新しいか
Qwen-Image-2.1-TurboはQwen-Image-2.1の8ステップ蒸留チェックポイントで、テキスト画像生成と画像編集に対応し、7Bの視覚生成アーキテクチャを使います。UnslothはQwen/Qwen-Image-2.1-Turbo(revision d65dbc9a7e8f6b5479e33dee6030eaab2a906509)から、unsloth/Qwen-Image-2.1-FP8と同じレシピで3形式を作成しました。norm、modulation、timestep embedding、およびINT8ではtxt_inをbf16のまま残し、それ以外のlinearを量子化しています。
Turboはtext encoderとVAEをQwen-Image-2.1と共有しており(text encoderはバイト単位で同一、VAEはbf16で同一)、unsloth/Qwen-Image-2.1-FP8のFP8 text encoderとbf16 VAEをそのまま組み合わせて使えます。
ファイルと品質
| ファイル | サイズ | 方式 | LPIPS(bf16比) |
|---|---|---|---|
Qwen-Image-2.1-Turbo-INT8-ConvRot.safetensors |
7.26 GB | INT8 W8A8、group-256 Hadamard rotation | 0.037 |
Qwen-Image-2.1-Turbo-INT8.safetensors |
7.26 GB | INT8 W8A8、rotationなし | 0.089 |
Qwen-Image-2.1-Turbo-FP8.safetensors |
7.12 GB | FP8 e4m3、per-row scales | 0.125 |
LPIPS(AlexNet)はbf16 Turbo transformerとの同一シード比較で、低いほど良い指標です。条件は8 steps、CFG 1、同梱sigma schedule、1024x1024、8プロンプト×2シードで、全実行で同じbf16 text encoderを使っています。
試し方・要件
CUDA対応のPyTorchビルドを入れたうえで、Diffusersのソース版と依存パッケージをインストールします。
pip install git+https://github.com/huggingface/diffusers.git
pip install "transformers>=5.17.0" accelerate pillow
パイプライン側でsampling sigmasを設定する機能(diffusers PR #14950)を含むmainビルドが必要です。ロードにはQwenImage21Pipelineを使います。ファイルはすべてpickleではなくsafetensors形式で、ロード時に任意コードを実行しません。ライセンスはotherです。

まだコメントはありません。