bartowski、321BのGLM-5.3-FlashをGGUF化しQ4_K_Mは200.83GB

スペック

総パラメータ321B
ライセンスMIT
重みの公開GGUF形式の量子化重み
配布形式・量子化Q8_0、Q6_K、Q6_K_S、Q5_K_M、Q5_K_S、Q4_1、Q4_K_M、IQ4_NL、Q4_K_S、Q4_0、IQ4_XS、IQ3_M、Q3_K_L、Q3_K_M、IQ3_XS、Q3_K_S、IQ3_XXS、Q2_K、IQ2_M
4bit量子化の目安メモリ約192.6GB(256GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

bartowskiは、zai-orgの321BモデルGLM-5.3-Flash-BF16をllama.cppでimatrix量子化したGGUFファイル群をHugging Faceのbartowski/GLM-5.3-Flash-BF16-GGUFで公開しました。標準的な選択肢として推奨しているQ4_K_Mのサイズは200.83GBです。

GLMはZ.aiが開発するAIモデルのファミリーで、文章生成や推論、コード作成、ツールを使う処理を対象としています。

何が新しいか

量子化にはllama.cpp release b11279を使っています。ライセンスはMITで、入力はテキストと画像に対応します(画像にはmmprojファイルが必要)。MTPによるスペキュレーティブデコーディングにも対応しています。全ファイルは分割形式で配布されています。

量子化ごとのサイズ

量子化 サイズ 原文の説明
Q8_0 341.50GB 最高品質、通常は不要
Q6_K 281.04GB ほぼ完全、推奨
Q6_K_S 268.17GB Q6_Kより少し小さい、推奨
Q5_K_M 243.69GB 高品質、推奨
Q5_K_S 227.91GB 高品質、推奨
Q4_1 202.61GB 旧形式、Apple siliconでtokens/wattが改善
Q4_K_M 200.83GB 多くの用途の標準、推奨
IQ4_NL 200.83GB IQ4_XSよりやや大きい
Q4_K_S 189.30GB 容量優先、推奨
Q4_0 184.09GB 旧形式、古いツールとの互換用
IQ4_XS 177.74GB Q4_K_Sより小さく同等性能、推奨
IQ3_M 166.63GB Q3_K_M相当
Q3_K_L 162.44GB 低RAM向け
Q3_K_M 155.02GB 低品質
IQ3_XS 147.36GB Q3_K_Sよりやや良い
Q3_K_S 147.36GB 非推奨
IQ3_XXS 138.83GB Q3系相当
Q2_K 125.67GB 非常に低品質だが使える

このほかIQ2_Mも用意されています。

試し方・プロンプト形式

プロンプト形式は次のとおりです。

[gMASK] Reasoning Effort: Max {system_prompt} {prompt}

ツール定義を使う場合は、# Tools以下に関数シグネチャをXMLタグ内で渡し、モデルは指定のXML形式で関数名と引数({arg-key-1} {arg-value-1}…)を出力します。画像入力にはmmprojファイルを併用します。

llama.cppはggml-orgが公開するC/C++製の推論ソフトウェアで、CPUと各社GPUの併用や、OpenAI互換APIサーバーを備えています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内