mlx-communityは、Qwen/Qwen3.5-0.8BをOptiQで意思決定モデルに変換した mlx-community/Qwen3.5-0.8B-decision をHugging Faceで公開しました。ベンチマーク独自の400件のテスト分割で、Accuracyは0.512です。
何が新しいか
このモデルは optiq lora train --decision で学習しており、backboneへのLoRAと新しいjoint schema headで構成します。noul、choice、scoreの3種類の質問を1回の処理(one pass)でスコアリングします。ライセンスはapache-2.0です。
QwenはAlibaba Cloudが開発する大規模言語モデルのファミリーで、MLXはAppleの機械学習研究チームが開発するAppleシリコン向けの配列計算フレームワークです。
Typed Decisionsでの評価結果
評価にはベンチマーク独自のfull 400-case test splitと、ベンチマーク自身の指標を使っています。
| 指標 | 値 |
|---|---|
| Accuracy | 0.512 |
| KL from gold(低いほど良い) | 0.3892 |
| Brier(低いほど良い) | 0.2094 |
| ECE(低いほど良い) | 0.1765 |
学習データはベンチマーク独自のtrain splitの1,080 recordsだけです。原文はこれをsmall-data resultと位置づけ、Clef modelsははるかに多くのデータで学習したと説明しています。
試し方・要件
Apple Silicon上でMLXとOptiQを使って実行します。起動コマンドは次のとおりです。
optiq serve --model mlx-community/
optiq serve は /v1/systemone エンドポイントを公開します。ディスク上のサイズは1.8 GBで、内訳はbf16 backbone、LoRA adapter、headです。学習とスコアリングにもOptiQを使っています。

まだコメントはありません。