LM Studio Teamは2026年9月18日、Inco AIのオープンソース推論エンジン「Splash」をLM Studio Bionicで利用する方法を公開しました。Incoのテストでは48 GBのM5 Pro上でQwen3.8-27Bのデコード速度が短いプロンプトで74 tokens per second、32Kコンテキストで54 tokens per secondに達したとしています。
Splash Engineとは
SplashはInco AIが開発した、Appleシリコン上で言語モデルをローカル実行するためのオープンソース推論エンジンです。Qwen3.6-35B-A3BとQwen3.8-27Bに特化して最適化されており、モデルごとに用意したGPUカーネルとメモリプランを備えます。各モデルには投機的デコーディング用の専用DFlash 2ドラフトモデルが同梱され、生成速度を引き上げます。
なおAppleシリコンはAppleがMac向けに設計するチップで、CPUやGPUを1つのSoCにまとめ、処理間で同じデータを共有するユニファイドメモリを持ちます。
計測値
Incoが48 GBのM5 Proで実施したQwen3.8-27Bのテスト結果は次の通りです。比較対象は、Incoの計測でSplashに次いで速かったエンジンです。
| 条件 | Splashの速度 | 比較対象エンジン比 |
|---|---|---|
| 短いプロンプト | 74 tokens per second | 約2倍 |
| 32Kコンテキスト | 54 tokens per second | — |
| 短いプロンプト・4同時リクエスト(合算) | 170 tokens per second | 3.9倍 |
動作要件
| 項目 | 条件 |
|---|---|
| Mac | M3以降 |
| macOS | 26.4以降 |
| LM Studio Bionic | 1.1.5以上 |
| 統合メモリ | 最低36 GB(Incoの推奨は48 GB以上) |
試し方
- LM Studio Bionic 1.1.5以降をダウンロードしてインストールし、アプリを開きます。
Settings > Runtimeに移動します。Experimental backendsのSplash (Metal)の横にあるDownloadをクリックし、エンジンをインストールします。Settings > Exploreに移動し、検索バーにHugging Faceのモデルリンクincoai/Qwen3.8-27B-Splashまたはincoai/Qwen3.6-35B-A3B-Splashを貼り付けます。- モデルを選択して
Downloadをクリックします。 - ダウンロードが終わったら新しいセッションを開始し、ローカルモデルピッカーからモデルを選択します。

まだコメントはありません。