Unsloth、Qwen-Image-2.1-TurboのFP8/INT8版を7.1GB台で公開

スペック

総パラメータ7B
ライセンスother
重みの公開safetensors形式の量子化重み
配布形式・量子化FP8 e4m3 per-row scales、INT8 W8A8(group-256 Hadamard rotationまたはrotationなし)
4bit量子化の目安メモリ約4.2GB(16GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

UnslothはHugging Faceで、Qwen-Image-2.1-Turboのtransformerを量子化したFP8版とINT8版を公開しました。14.2 GBのbf16 transformerを7.12〜7.26 GBに置き換え、推奨ファイルのINT8-ConvRotはbf16比のLPIPSが0.037です。

UnslothはAIモデルの実行・学習のためのツール群を開発するチームで、量子化形式への出力にも対応しています。

何が新しいか

Qwen-Image-2.1-TurboはQwen-Image-2.1の8ステップ蒸留チェックポイントで、テキスト画像生成と画像編集に対応し、7Bの視覚生成アーキテクチャを使います。UnslothはQwen/Qwen-Image-2.1-Turbo(revision d65dbc9a7e8f6b5479e33dee6030eaab2a906509)から、unsloth/Qwen-Image-2.1-FP8と同じレシピで3形式を作成しました。norm、modulation、timestep embedding、およびINT8ではtxt_inをbf16のまま残し、それ以外のlinearを量子化しています。

Turboはtext encoderとVAEをQwen-Image-2.1と共有しており(text encoderはバイト単位で同一、VAEはbf16で同一)、unsloth/Qwen-Image-2.1-FP8のFP8 text encoderとbf16 VAEをそのまま組み合わせて使えます。

ファイルと品質

ファイル サイズ 方式 LPIPS(bf16比)
Qwen-Image-2.1-Turbo-INT8-ConvRot.safetensors 7.26 GB INT8 W8A8、group-256 Hadamard rotation 0.037
Qwen-Image-2.1-Turbo-INT8.safetensors 7.26 GB INT8 W8A8、rotationなし 0.089
Qwen-Image-2.1-Turbo-FP8.safetensors 7.12 GB FP8 e4m3、per-row scales 0.125

LPIPS(AlexNet)はbf16 Turbo transformerとの同一シード比較で、低いほど良い指標です。条件は8 steps、CFG 1、同梱sigma schedule、1024x1024、8プロンプト×2シードで、全実行で同じbf16 text encoderを使っています。

試し方・要件

CUDA対応のPyTorchビルドを入れたうえで、Diffusersのソース版と依存パッケージをインストールします。

pip install git+https://github.com/huggingface/diffusers.git
pip install "transformers>=5.17.0" accelerate pillow

パイプライン側でsampling sigmasを設定する機能(diffusers PR #14950)を含むmainビルドが必要です。ロードにはQwenImage21Pipelineを使います。ファイルはすべてpickleではなくsafetensors形式で、ロード時に任意コードを実行しません。ライセンスはotherです。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内