bartowski、jebadiah-9b-v2のGGUF量子化版を公開 Q4_K_Mは5.98GB

スペック

総パラメータ10B
ライセンスapache-2.0
重みの公開GGUFファイルとして公開
配布形式・量子化bf16、Q8_0、Q6_K_L、Q6_K、Q6_K_S、Q5_K_M、Q5_K_S、Q4_K_Lなど
4bit量子化の目安メモリ約6GB(16GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

bartowskiは、frontier-infraのモデルjebadiah-9b-v2をllama.cpp向けに量子化したfrontier-infra_jebadiah-9b-v2-GGUFをHugging Faceで公開しました。量子化にはllama.cpp release b11184を使用し、推奨ファイルとしてfrontier-infra_jebadiah-9b-v2-Q4_K_M.gguf(5.98GB)を案内しています。

モデルの仕様

原モデルはfrontier-infra/jebadiah-9b-v2で、パラメータ数は10B、ライセンスはapache-2.0です。入力はテキストと画像に対応し、画像入力にはmmprojファイルが必要です。投機的デコーディングはMTPで対応し、imatrixにも対応しています。

配布ファイルとサイズ

bf16のフル重みからQ4_K系まで複数の量子化が用意されています。

ファイル Quant type サイズ
frontier-infra_jebadiah-9b-v2-bf16.gguf bf16 18.41GB
frontier-infra_jebadiah-9b-v2-Q8_0.gguf Q8_0 9.80GB
frontier-infra_jebadiah-9b-v2-Q6_K_L.gguf Q6_K_L 8.24GB
frontier-infra_jebadiah-9b-v2-Q6_K.gguf Q6_K 7.93GB
frontier-infra_jebadiah-9b-v2-Q6_K_S.gguf Q6_K_S 7.65GB
frontier-infra_jebadiah-9b-v2-Q5_K_M.gguf Q5_K_M 7.01GB
frontier-infra_jebadiah-9b-v2-Q5_K_S.gguf Q5_K_S 6.63GB
frontier-infra_jebadiah-9b-v2-Q4_K_L.gguf Q4_K_L 6.34GB
frontier-infra_jebadiah-9b-v2-Q4_K_M.gguf Q4_K_M 5.98GB

bartowskiはQ8_0を「入手できる最大の量子化だが通常は不要」、Q6_K_LとQ6_K、Q6_K_Sを「非常に高品質でほぼ完全」として推奨、Q5_K_MとQ5_K_Sを「高品質」として推奨と説明しています。Q6_K_SはQ6_Kより少し小さく、モデルのほぼ全体をQ6_K精度で保持するとしています。どれを選ぶか決められない場合は、サイズと性能のバランスが取れるQ4_K_Mを挙げています。

試し方

GGUFファイルをllama.cppで実行します。プロンプト形式は以下の通りです。

system {system_prompt} user {prompt} assistant

ツール定義を含める場合は、systemに# Toolsとして利用可能な関数のJSONを列挙する形式が示されています。関数呼び出しは指定の形式に従い、内側のブロックをXMLタグ内にネストする必要があり、必須パラメータを必ず指定します。関数呼び出しの理由は自然言語で呼び出しの前にのみ記述でき、後ろには書けません。利用できる関数呼び出しがない場合は、通常どおり現在の知識で回答し、関数呼び出しについてユーザーに伝えないよう指示されています。

画像入力を使う場合はmmprojファイルを併用します。ダウンロードはHugging Face CLIから行う手順がリポジトリ内で案内されています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内