LocalAI 4.10.0公開、280PRでフリート運用ダッシュボードとCLIベンチマークを追加

LocalAIは2026年9月17日、LocalAI 4.10.0をリリースしました。28日間で280プルリクエスト、382コミット、633ファイルの変更を取り込み、フラットなノード一覧をクラスタ全体のフリート運用ダッシュボードへ置き換え、プライベートなモデルソースの認証を1つのcredentials.yamlにまとめ、CLIベンチマークコマンドを追加しています。

主な変更

フリート運用ダッシュボードは、Nodesページのフラットな一覧をリアルタイムのクラスタ概況に置き換えるものです。ヘルス帯の集約、VRAM/RAM/CPU/ディスクの容量ゲージ、ワーカー間のレプリカ配置を示す稼働モデルタブ、並列度を制限した一括のdrain/resume/remove、スライドアウト式のノードインスペクタを備えます。ワーカーは登録時とハートビートでCPUテレメトリを報告するようになりました。

credentials.yamlは、OCIレジストリ、ギャラリー、HTTPダウンロード、github: URIの認証情報を1ファイルで扱います。Basic認証、Bearerトークン、カスタムヘッダーに対応し、シークレットは使用時に読み込まれるため、ローテーションされたKubernetesのシークレットマウントが再起動なしで反映されます。ログとエラーメッセージでは完全にマスクされます。

vllm-cppの動画エンジンは、モデル設定のlora_adaptersとlora_scalesを読み取り、エンジン読み込み時にLoRA差分をDiT重みへ融合します。LTX2.5とMiniMax-H3の両方に対して1つの汎用パスで動作します。モデル設定のenv:マップでバックエンドプロセスに環境変数を注入できるようになり、CUDA_VISIBLE_DEVICESやVLLM_CACHE_DIRをモデルごとに固定できます。/v1/models/capabilitiesにはcontext_sizeが追加され、クライアントはモデル設定を別経路で参照せずに有効なコンテキストウィンドウを読み取れます。

template.system_messages_after_firstは、会話の途中でシステム指示を追加するエージェントフレームワークがQwen3.x系モデルをクラッシュさせる問題に対応し、後続のシステムターンを先頭のシステムメッセージへマージするか、ユーザーターンとして転送します。

ベンチマークコマンドの使い方

CLIのlocal-ai benchmarkコマンドは、設定済みのテキストモデルに対してエンドツーエンドの遅延とスループットを測定します。ウォームアップと測定実行における最小・平均・最大遅延、およびcompletion tokens/secを報告し、表形式とJSON形式で出力できます。リダイレクトのブロックとAPIキーの秘匿も行います。

修正内容

CUDA向けのds4バックエンドは4件の修正で、ターゲットアーキテクチャ向けのカーネルビルド、中断された推論のキャンセル、生成境界の強制、プリフィルされた推論とコンテンツの分離が入りました。分散モードはステージング、liveness、仮想モデル、コントロールプレーンのデータベースにまたがる7件の安定化修正を受けています。全テキストバックエンドでenable_thinking=falseが尊重されるようになり、go-m1cpuをv0.2.2へ更新してApple M5ハードウェアでの起動時SIGSEGVを解消しました。

CVE関連は4件を修正しています。

対象 識別子
ip-address 10.3.1 CVE-2026-69192
containerd 1.7.32 / 1.7.33 CVE-2026-46680、CVE-2026-53488
react-router GHSA-qwww-vcr4-c8h2

このほか、チャット設定のフォーカスモード切り替え、1:Nレジストリ向けの顔登録リプレイ、stablediffusion-ggmlのROCmビルド、分散スケジューリングルールのインプレース編集、OCIレイヤーのダウンロード再開が加わりました。

リリースの規模

項目 数値
マージされたプルリクエスト 280
コミット 382
変更ファイル 633(+46,550 / -3,316)
開発期間 28日(2026-08-20〜2026-09-17)
人間の貢献者 29人(うち初参加16人)
ギャラリーエントリー 1,707→1,847(+140)

変更の内訳はcore/が314ファイルで+25,773 / -1,993、gallery/が+6,734 / -417、backend/が154ファイルで+4,932 / -433、pkg/が55ファイルで+4,392 / -91、docs/が48ファイルで+2,526 / -101、swagger/が+322となっています。

背景

vLLMは大規模言語モデルの推論とAPI配信のためのライブラリで、PagedAttentionによるメモリ管理や連続バッチ処理、分散推論を備えます。AMD ROCmはAMDが提供するGPU計算向けのオープンなソフトウェア群です。MiniMaxは基盤モデルを開発するAI企業で、文章、音声、画像、動画、音楽を扱うマルチモーダルモデルを提供しています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内