huihui-aiは、Qwen/Qwen3.8-27Bにabliterationを適用して拒否応答を減らしたHuihui-Qwen3.8-27B-abliterated-GGUFをHugging Faceで公開しています。派生シリーズごとに層17〜52、または層22〜52(0-based)だけをablatedしています。
huihui-aiは、Hugging Faceで言語モデルの改変版を公開している開発者アカウントです。abliterationを適用したモデルを配布しています。
何が新しいか
モデルカードは、このモデルをTransformerLensを使わずにLLMの拒否応答を除去する「粗い概念実証」と説明しています。手法はSumandora/remove-refusals-with-transformersを参照しています。元モデルのMTPとvisual部分には手を加えていません。ライセンスはapache-2.0です。
派生シリーズは複数あり、それぞれ別のGGUFを元にしています。
| シリーズ | 元GGUF | ablated層(0-based) |
|---|---|---|
| UD | unsloth/Qwen3.8-27B-GGUF | 17〜52 |
| UD-DW | unsloth/Qwen3.8-27B-GGUF | 22〜52 |
| GSQ-RCO | ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF | 22〜52 |
| Ternary | prism-ml/Ternary-Bonsai-2-27B-gguf | 22〜52 |
| Swift | ukisai/Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF | 22〜52 |
huihui-aiは、Ternary・Swiftを「テスト/検証」と位置づけています。元のGGUFとは変換後のサイズが異なる場合があります。Ternaryでは一部の重みをPTQ1からQ2_KまたはQ3_Kへ変換しています。
独自の量子化形式
Q8_0未満の版では、ablationの対象テンソル(token_embd、output、ffn_down、ssm_out、attn_output)をQ8_0へ変換し、ファイル名をK_Lとしています。Q8_0版では同じテンソルをBF16にしたQ8_0_Lを用意しています。標準的な量子化ではないため、Q2_K_LがQ3_KやQ4_Kより大きくなることがあります。
Q2_K_L〜Q6_K_Lは、Qwen3.8-27B-tensor_types-Q6_K_L.txtを使って次のように変換します。
llama-quantize --allow-requantize --tensor-type-file Qwen3.8-27B-tensor_types-Q6_K_L.txt Huihui-Qwen3.8-27B-abliterated-bf16.gguf Huihui-Qwen3.8-27B-abliterated-Q6_K_L.gguf Q6_K
Q8_0_LはQwen3.8-27B-tensor_types-Q8_0_L.txtを指定し、末尾の型をQ8_0にします。
試し方・要件
- Ollama(最新版):
ollama run huihui_ai/Qwen3.8-abliterated - llama.cpp(最新版):
llama-cli -m huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf -c 262144 - Ternaryシリーズ: ternary hybrid-attentionカーネルを含むPrismML-Eng/llama.cppフォークが必要です。stock llama.cppではTernaryシリーズを実行できません。
利用上の注意
モデルカードによると、このモデルは安全フィルタリングが大幅に低減されており、センシティブまたは不適切な出力を生成する可能性があります。huihui-aiは研究、テスト、管理された環境での利用を推奨し、本番環境や公開向けの商用利用は避けるよう求めています。あわせて、出力のリアルタイム監視と、必要に応じた手動レビューも推奨しています。利用者には地域の法律と倫理基準を守ることを求めており、生成内容に伴う法的・倫理的リスクは利用者が負います。

まだコメントはありません。