Magnitude、端末上でカーネル調整しllama.cpp比最大2倍の推論

Magnitude(YC S25)は、利用者のデバイス上でカーネルをコンパイル・調整するオープンソースのエージェント向け推論エンジン「Magnitude」をHacker NewsのLaunch HNで公開し、オープンモデルをllama.cpp比で最大2倍高速に動かせるとしています。Apple Silicon、NVIDIA、AMD、CPUのみの環境に対応し、ライセンスはApache 2.0です。

llama.cppは、ggml-orgが公開するC/C++実装の推論ソフトウェアで、OpenAI互換APIサーバーも備えます。

何が新しいか

Magnitudeによると、llama.cpp、Ollama、LM Studioは幅広いハードウェア向けにプリコンパイルしたカーネルを配布しています。これに対しMagnitudeは、モデルを実行する前に実際のデバイス上でカーネルをコンパイル・調整し、そのチップに合わせます。人気のopen-weightファミリー向けには手作業で最適化したカーネルを書いているとしています。エージェントの同時セッションではプレフィックスキャッシュを共有し、速度低下を抑えます。メモリはエージェント停止時に解放します。

公表値

項目 値
llama.cpp比の速度 最大2倍
Metalでのデコード速度向上 92%
CUDAでのデコード速度向上 19%
エージェントあたりのメモリ削減 27%
GitHubスター / フォーク 5.6k / 396

対応環境と試し方

  • ハードウェア: Apple Silicon、NVIDIA GPU、AMD GPU、またはCPUのみ。固定の最低要件はなく、メモリが多いほど大きいモデルを動かせます。
  • OS: macOS、Linux、Windows
  • 対応モデル一覧: magnitude.dev/models

手順は次のとおりです。

  1. Magnitudeをダウンロード・インストールし、アプリを開く
  2. Discoverで推奨モデルを選んでダウンロードする
  3. Connectionsでエージェントを接続する

デスクトップアプリにmagnitude CLIが同梱されており、別途インストールは不要です。Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi、Clineはワンクリックで接続でき、それ以外のエージェントはOpenAI互換API経由で使えます。

プライバシーと費用

プロンプト、ファイル、モデルは利用者のマシン内に留まり、モデルのダウンロード後はインターネット接続が不要です。トークン費用はかかりません。Hacker Newsの投稿は83ポイント・42コメントを集めています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内