LM Studio Bionic、Inco AIのSplash EngineでQwen3.8-27Bが74 tok/s

LM Studio Teamは2026年9月18日、Inco AIのオープンソース推論エンジン「Splash」をLM Studio Bionicで利用する方法を公開しました。Incoのテストでは48 GBのM5 Pro上でQwen3.8-27Bのデコード速度が短いプロンプトで74 tokens per second、32Kコンテキストで54 tokens per secondに達したとしています。

Splash Engineとは

SplashはInco AIが開発した、Appleシリコン上で言語モデルをローカル実行するためのオープンソース推論エンジンです。Qwen3.6-35B-A3BとQwen3.8-27Bに特化して最適化されており、モデルごとに用意したGPUカーネルとメモリプランを備えます。各モデルには投機的デコーディング用の専用DFlash 2ドラフトモデルが同梱され、生成速度を引き上げます。

なおAppleシリコンはAppleがMac向けに設計するチップで、CPUやGPUを1つのSoCにまとめ、処理間で同じデータを共有するユニファイドメモリを持ちます。

計測値

Incoが48 GBのM5 Proで実施したQwen3.8-27Bのテスト結果は次の通りです。比較対象は、Incoの計測でSplashに次いで速かったエンジンです。

条件 Splashの速度 比較対象エンジン比
短いプロンプト 74 tokens per second 約2倍
32Kコンテキスト 54 tokens per second —
短いプロンプト・4同時リクエスト(合算) 170 tokens per second 3.9倍

動作要件

項目 条件
Mac M3以降
macOS 26.4以降
LM Studio Bionic 1.1.5以上
統合メモリ 最低36 GB(Incoの推奨は48 GB以上)

試し方

  1. LM Studio Bionic 1.1.5以降をダウンロードしてインストールし、アプリを開きます。
  2. Settings > Runtime に移動します。
  3. Experimental backends の Splash (Metal) の横にある Download をクリックし、エンジンをインストールします。
  4. Settings > Explore に移動し、検索バーにHugging Faceのモデルリンク incoai/Qwen3.8-27B-Splash または incoai/Qwen3.6-35B-A3B-Splash を貼り付けます。
  5. モデルを選択して Download をクリックします。
  6. ダウンロードが終わったら新しいセッションを開始し、ローカルモデルピッカーからモデルを選択します。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内