llama.cpp v0.6.0公開、拡張バッチAPIと320BのGLM-5.3-Flash対応

スペック

総パラメータ320B
4bit量子化の目安メモリ約192GB(256GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

llama.cppはv0.6.0を公開し、トークンと埋め込みを混在させられる拡張バッチAPI llama_batch_extとllama_process()を追加したほか、320BのテキストとビジョンのハイブリッドモデルGLM-5.3-Flash(GLM5-Next)に対応しました。基盤ライブラリのggmlもv0.26.0へ更新しています。

llama.cppはggml-orgが公開する、C/C++で実装された言語モデル・視覚言語モデルの推論ソフトウェアです。

新しいAPIとモデル対応

llama_batch_extは、トークンと埋め込みが混在するバッチに加え、MTPやdeepstackモデル向けにトークン単位の"state"埋め込みを扱えます。examples、投機的デコード、mtmd、サーバーはすでにこのAPIへ移行しました。include/llama.hにはllama_embd、llama_process_type、llama_get_causal_attn()も加わり、セッション形式はLLAMA_SESSION_VERSION 11、LLAMA_STATE_SEQ_VERSION 4に上がっています。

新たに対応したモデルは次のとおりです。

  • GLM-5.3-Flash(GLM5-Next): KDA/DSAハイブリッド、mHC、MoEを備えるテキスト+ビジョンモデル
  • Clef: テキストとビジョンの両方に対応する意思決定モデル
  • Nimble: 意思決定モデル
  • Ling 3.0 VL: BailingMoeV3アーキテクチャに統合
  • LFM2.5-Encoder-230M/350M

Qwen4Expでは、MTP speculative decodingを使えるようになり、DGX Sparkでデコード速度が約1.5倍になりました。あわせて正確性の修正が入り、indexer scoreのメモリも半減しています。

サーバーとWeb UI

サーバーには、意思決定モデル(laya、julia-1、lev、openjev、kev、nimble)向けの専用エンドポイント/v1/systemoneが加わりました。/v1/embeddingsはtypedなvision/audio/video入力を受け付けるようになり、不正なリクエストにはHTTP 400を返します。GET /v1/modelsはモデルの入出力モダリティを報告します。

Web UIは刷新され、次の機能が入りました。

  • モデルダウンロードパイプライン
  • Hugging Face Hubデータレイヤー
  • モデルのメモリ適合推定

バックエンドの性能改善

対象 変更内容
Metal F16 KV向けtensor API Flash Attentionカーネル
Metal 投機的・バッチデコード向けfew-row MMA mat-mul。Apple GPUで最大約3倍
Vulkan 量子化K/V向けsparse flash attention
CUDA W4A4(NVFP4/MXFP4)mul_matパス、MMVQ shared-expert融合
CPU BF16演算、タイル化k-quant mul_mat

ggml v0.26.0はこのほか、SYCL・Vulkan・Metalのsparse flash attentionカーネルとlightning indexerの改善を含みます。GGUFサイズ検証を厳格化してモデル読み込みを高速化し、Windows ARM64 MSVCビルドにも対応しました。対応するNightly buildはb11429です。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内