Magnitude(YC S25)は、利用者のデバイス上でカーネルをコンパイル・調整するオープンソースのエージェント向け推論エンジン「Magnitude」をHacker NewsのLaunch HNで公開し、オープンモデルをllama.cpp比で最大2倍高速に動かせるとしています。Apple Silicon、NVIDIA、AMD、CPUのみの環境に対応し、ライセンスはApache 2.0です。
llama.cppは、ggml-orgが公開するC/C++実装の推論ソフトウェアで、OpenAI互換APIサーバーも備えます。
何が新しいか
Magnitudeによると、llama.cpp、Ollama、LM Studioは幅広いハードウェア向けにプリコンパイルしたカーネルを配布しています。これに対しMagnitudeは、モデルを実行する前に実際のデバイス上でカーネルをコンパイル・調整し、そのチップに合わせます。人気のopen-weightファミリー向けには手作業で最適化したカーネルを書いているとしています。エージェントの同時セッションではプレフィックスキャッシュを共有し、速度低下を抑えます。メモリはエージェント停止時に解放します。
公表値
| 項目 | 値 |
|---|---|
| llama.cpp比の速度 | 最大2倍 |
| Metalでのデコード速度向上 | 92% |
| CUDAでのデコード速度向上 | 19% |
| エージェントあたりのメモリ削減 | 27% |
| GitHubスター / フォーク | 5.6k / 396 |
対応環境と試し方
- ハードウェア: Apple Silicon、NVIDIA GPU、AMD GPU、またはCPUのみ。固定の最低要件はなく、メモリが多いほど大きいモデルを動かせます。
- OS: macOS、Linux、Windows
- 対応モデル一覧: magnitude.dev/models
手順は次のとおりです。
- Magnitudeをダウンロード・インストールし、アプリを開く
- Discoverで推奨モデルを選んでダウンロードする
- Connectionsでエージェントを接続する
デスクトップアプリにmagnitude CLIが同梱されており、別途インストールは不要です。Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi、Clineはワンクリックで接続でき、それ以外のエージェントはOpenAI互換API経由で使えます。
プライバシーと費用
プロンプト、ファイル、モデルは利用者のマシン内に留まり、モデルのダウンロード後はインターネット接続が不要です。トークン費用はかかりません。Hacker Newsの投稿は83ポイント・42コメントを集めています。

まだコメントはありません。