llama.cppはv0.6.0を公開し、トークンと埋め込みを混在させられる拡張バッチAPI llama_batch_extとllama_process()を追加したほか、320BのテキストとビジョンのハイブリッドモデルGLM-5.3-Flash(GLM5-Next)に対応しました。基盤ライブラリのggmlもv0.26.0へ更新しています。
llama.cppはggml-orgが公開する、C/C++で実装された言語モデル・視覚言語モデルの推論ソフトウェアです。
新しいAPIとモデル対応
llama_batch_extは、トークンと埋め込みが混在するバッチに加え、MTPやdeepstackモデル向けにトークン単位の"state"埋め込みを扱えます。examples、投機的デコード、mtmd、サーバーはすでにこのAPIへ移行しました。include/llama.hにはllama_embd、llama_process_type、llama_get_causal_attn()も加わり、セッション形式はLLAMA_SESSION_VERSION 11、LLAMA_STATE_SEQ_VERSION 4に上がっています。
新たに対応したモデルは次のとおりです。
- GLM-5.3-Flash(GLM5-Next): KDA/DSAハイブリッド、mHC、MoEを備えるテキスト+ビジョンモデル
- Clef: テキストとビジョンの両方に対応する意思決定モデル
- Nimble: 意思決定モデル
- Ling 3.0 VL: BailingMoeV3アーキテクチャに統合
- LFM2.5-Encoder-230M/350M
Qwen4Expでは、MTP speculative decodingを使えるようになり、DGX Sparkでデコード速度が約1.5倍になりました。あわせて正確性の修正が入り、indexer scoreのメモリも半減しています。
サーバーとWeb UI
サーバーには、意思決定モデル(laya、julia-1、lev、openjev、kev、nimble)向けの専用エンドポイント/v1/systemoneが加わりました。/v1/embeddingsはtypedなvision/audio/video入力を受け付けるようになり、不正なリクエストにはHTTP 400を返します。GET /v1/modelsはモデルの入出力モダリティを報告します。
Web UIは刷新され、次の機能が入りました。
- モデルダウンロードパイプライン
- Hugging Face Hubデータレイヤー
- モデルのメモリ適合推定
バックエンドの性能改善
| 対象 | 変更内容 |
|---|---|
| Metal | F16 KV向けtensor API Flash Attentionカーネル |
| Metal | 投機的・バッチデコード向けfew-row MMA mat-mul。Apple GPUで最大約3倍 |
| Vulkan | 量子化K/V向けsparse flash attention |
| CUDA | W4A4(NVFP4/MXFP4)mul_matパス、MMVQ shared-expert融合 |
| CPU | BF16演算、タイル化k-quant mul_mat |
ggml v0.26.0はこのほか、SYCL・Vulkan・Metalのsparse flash attentionカーネルとlightning indexerの改善を含みます。GGUFサイズ検証を厳格化してモデル読み込みを高速化し、Windows ARM64 MSVCビルドにも対応しました。対応するNightly buildはb11429です。

まだコメントはありません。