bartowskiは、frontier-infraのモデルjebadiah-9b-v2をllama.cpp向けに量子化したfrontier-infra_jebadiah-9b-v2-GGUFをHugging Faceで公開しました。量子化にはllama.cpp release b11184を使用し、推奨ファイルとしてfrontier-infra_jebadiah-9b-v2-Q4_K_M.gguf(5.98GB)を案内しています。
モデルの仕様
原モデルはfrontier-infra/jebadiah-9b-v2で、パラメータ数は10B、ライセンスはapache-2.0です。入力はテキストと画像に対応し、画像入力にはmmprojファイルが必要です。投機的デコーディングはMTPで対応し、imatrixにも対応しています。
配布ファイルとサイズ
bf16のフル重みからQ4_K系まで複数の量子化が用意されています。
| ファイル | Quant type | サイズ |
|---|---|---|
frontier-infra_jebadiah-9b-v2-bf16.gguf |
bf16 | 18.41GB |
frontier-infra_jebadiah-9b-v2-Q8_0.gguf |
Q8_0 | 9.80GB |
frontier-infra_jebadiah-9b-v2-Q6_K_L.gguf |
Q6_K_L | 8.24GB |
frontier-infra_jebadiah-9b-v2-Q6_K.gguf |
Q6_K | 7.93GB |
frontier-infra_jebadiah-9b-v2-Q6_K_S.gguf |
Q6_K_S | 7.65GB |
frontier-infra_jebadiah-9b-v2-Q5_K_M.gguf |
Q5_K_M | 7.01GB |
frontier-infra_jebadiah-9b-v2-Q5_K_S.gguf |
Q5_K_S | 6.63GB |
frontier-infra_jebadiah-9b-v2-Q4_K_L.gguf |
Q4_K_L | 6.34GB |
frontier-infra_jebadiah-9b-v2-Q4_K_M.gguf |
Q4_K_M | 5.98GB |
bartowskiはQ8_0を「入手できる最大の量子化だが通常は不要」、Q6_K_LとQ6_K、Q6_K_Sを「非常に高品質でほぼ完全」として推奨、Q5_K_MとQ5_K_Sを「高品質」として推奨と説明しています。Q6_K_SはQ6_Kより少し小さく、モデルのほぼ全体をQ6_K精度で保持するとしています。どれを選ぶか決められない場合は、サイズと性能のバランスが取れるQ4_K_Mを挙げています。
試し方
GGUFファイルをllama.cppで実行します。プロンプト形式は以下の通りです。
system {system_prompt} user {prompt} assistant
ツール定義を含める場合は、systemに# Toolsとして利用可能な関数のJSONを列挙する形式が示されています。関数呼び出しは指定の形式に従い、内側のブロックをXMLタグ内にネストする必要があり、必須パラメータを必ず指定します。関数呼び出しの理由は自然言語で呼び出しの前にのみ記述でき、後ろには書けません。利用できる関数呼び出しがない場合は、通常どおり現在の知識で回答し、関数呼び出しについてユーザーに伝えないよう指示されています。
画像入力を使う場合はmmprojファイルを併用します。ダウンロードはHugging Face CLIから行う手順がリポジトリ内で案内されています。

まだコメントはありません。