arXivで公開された研究は、13ファミリー・27個のGGUF量子化アーティファクトを429語の希少な英単語で監査し、Q2_K(約2.6 bits per weight)では2B未満の全モデルで定義性能がベースライン比20〜67%低下したと報告しました。流暢に単語を使えても、その意味を説明できなくなる現象です。
GGUFはGGMLプロジェクトで仕様が公開されている推論用モデルのバイナリ形式で、GGMLを使う推論ソフトウェアで利用されます。
何が新しいか
論文タイトルは「Saying, Not Knowing: Aggressively GGUF-Quantized Small Language Models Still Write Rare Words They Can No Longer Define」です。研究者らは、GGUFの混合精度K量子化が一般消費者向けハードウェアでオープンウェイトモデルを動かす一般的な手段である一方、細かな語彙能力への影響は特徴づけられていなかったと述べています。Q2_Kでの挙動は次の3群に分かれました。
- 使用不能になる完全な崩壊
- サブ2Bモデルでの深刻な意味的乖離
- 約3B超での概ね頑健な保持
サブ2Bモデルでは、定義の損失が単語を文に含める能力の損失の通常数倍に達しました。
評価方法と数値
各モデルを公開された量子化ラダーに沿ってQ2_Kまで評価し、2種類のプローブを使いました。プロンプトで与えた単語を表面的に含められるか、その単語を一文で定義できるかです。定義は段階的な複数同義語マッチャーで採点し、全定義を盲検LLM判定で調べ、人手で確認しました。
| 項目 | 値 |
|---|---|
| 量子化アーティファクト数 | 27 |
| モデルファミリー / バックボーン | 13 / 4 |
| パラメータ規模 | 0.35B〜14B |
| 希少語数 | 429(頻度検証済み) |
| サブ2BのQ2_K定義性能低下 | ベースライン比20〜67% |
| 希少度と損失が相関したサブ2B | 7件中6件 |
| 希少語が一般語(100語)より損失大 | 8件全て、うち6件で有意 |
| 語彙サイズと損傷の相関 | Spearman rho=0.12 |
| パラメータ数と損傷の相関 | Spearman rho=0.72 |
| 同一トークナイザー内でパラメータ数の影響を確認 | 6ファミリー中5件 |
Q4_K_Mでは、1B以上のモデルが語彙的にクリーンな状態を維持しました。
パープレキシティでは判別できない
損傷は頻度依存・提供元依存で、WikiText-2のパープレキシティとは対応しませんでした。9つのアーティファクト対応ラダーの比較では、Q2のパープレキシティ悪化がほぼ同じ(44.7%/47.6%)でも、定義の損失は一方が3.6%、もう一方が43.6%でした。著者らは、意味が重要な分野でのハードウェア制約下の導入にリスクがあるとし、検証はアーティファクトごとに行う必要があると結論づけています。

まだコメントはありません。