llama.cpp b11536、GGUFから訓練時コンテキスト長を取得しModels Managerで活用

llama.cppはリリースb11536(#30228)で、GGUFメタデータから訓練時コンテキスト長を読み取るcommon_get_gguf_n_ctx_trainを追加し、GET /modelsがcontext_lengthを返すようにしました。Models ManagerはこれによりHugging Face Hub APIを無効にした状態でもContext列の表示・並べ替え・絞り込みができます。

llama.cppはggml-orgが公開するC/C++実装の推論ソフトウェアで、OpenAI互換APIサーバーを備えます。

何が新しいか

  • common: common_get_gguf_n_ctx_trainはモデル全体をロードせず、common_get_decision_typeと同様にメタデータだけを開いて(no_alloc).context_lengthを読み取ります。u32とu64の値を受け付け、ファイルが存在しない・読み取れない・無効・コンテキスト長がない場合は0を返します。
  • server: モダリティ読み取りのためにオフラインでモデルファイルを解決しているupdate_capsが、同じGGUFメタデータから訓練時コンテキストも読み取ります。GET /modelsは既知の場合にcontext_lengthとして返すため、ルーターの一覧はHubへのリクエストなしでコンテキスト長を持ちます。
  • UI: Models Managerは一覧のcontext_lengthをHubレコードより先に読み、Context列、コンテキストでのソート、フィルタに使います。

サーバー側の調整

レビュー後の修正で、サーバーはモデルごとに1回のGGUFオープンでdecision typeと訓練時コンテキストを読むようになりました。モデルローダーと同様にUINT32のcontext lengthだけを受け付け、n_ctx_trainを他のcapsと一緒にリセットするため、リフレッシュに失敗した場合は値が破棄されます。

UIの変更

  • お気に入りモデルはセレクターでホバー前からローズ色のハートを表示し、ホバー時は取り消し用の斜線入りハートに置き換わります。管理テーブルでもバッジとケイパビリティの後に同じハートを表示します。
  • お気に入りモデルのグルーピングを修正しました。
  • Status列のソートを削除しました。
  • ブラウザテストで、ソートと検索、Hubキャッシュによるコンテキストフィルタ、ソート後に詳細が届いた際の再ソートを検証します。

各コミットにはAssisted-by: pi:zai-org/GLM-5.3-Flash、Co-authored-by: Pascalが記されています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内