bartowskiは、zai-orgの321BモデルGLM-5.3-Flash-BF16をllama.cppでimatrix量子化したGGUFファイル群をHugging Faceのbartowski/GLM-5.3-Flash-BF16-GGUFで公開しました。標準的な選択肢として推奨しているQ4_K_Mのサイズは200.83GBです。
GLMはZ.aiが開発するAIモデルのファミリーで、文章生成や推論、コード作成、ツールを使う処理を対象としています。
何が新しいか
量子化にはllama.cpp release b11279を使っています。ライセンスはMITで、入力はテキストと画像に対応します(画像にはmmprojファイルが必要)。MTPによるスペキュレーティブデコーディングにも対応しています。全ファイルは分割形式で配布されています。
量子化ごとのサイズ
| 量子化 | サイズ | 原文の説明 |
|---|---|---|
Q8_0 |
341.50GB | 最高品質、通常は不要 |
Q6_K |
281.04GB | ほぼ完全、推奨 |
Q6_K_S |
268.17GB | Q6_Kより少し小さい、推奨 |
Q5_K_M |
243.69GB | 高品質、推奨 |
Q5_K_S |
227.91GB | 高品質、推奨 |
Q4_1 |
202.61GB | 旧形式、Apple siliconでtokens/wattが改善 |
Q4_K_M |
200.83GB | 多くの用途の標準、推奨 |
IQ4_NL |
200.83GB | IQ4_XSよりやや大きい |
Q4_K_S |
189.30GB | 容量優先、推奨 |
Q4_0 |
184.09GB | 旧形式、古いツールとの互換用 |
IQ4_XS |
177.74GB | Q4_K_Sより小さく同等性能、推奨 |
IQ3_M |
166.63GB | Q3_K_M相当 |
Q3_K_L |
162.44GB | 低RAM向け |
Q3_K_M |
155.02GB | 低品質 |
IQ3_XS |
147.36GB | Q3_K_Sよりやや良い |
Q3_K_S |
147.36GB | 非推奨 |
IQ3_XXS |
138.83GB | Q3系相当 |
Q2_K |
125.67GB | 非常に低品質だが使える |
このほかIQ2_Mも用意されています。
試し方・プロンプト形式
プロンプト形式は次のとおりです。
[gMASK] Reasoning Effort: Max {system_prompt} {prompt}
ツール定義を使う場合は、# Tools以下に関数シグネチャをXMLタグ内で渡し、モデルは指定のXML形式で関数名と引数({arg-key-1} {arg-value-1}…)を出力します。画像入力にはmmprojファイルを併用します。
llama.cppはggml-orgが公開するC/C++製の推論ソフトウェアで、CPUと各社GPUの併用や、OpenAI互換APIサーバーを備えています。

まだコメントはありません。