mlx-community、Qwen3.5-0.8Bを意思決定モデル化し正解率0.512

スペック

ライセンスapache-2.0
配布形式・量子化bf16 backbone、LoRA adapter、head

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

mlx-communityは、Qwen/Qwen3.5-0.8BをOptiQで意思決定モデルに変換した mlx-community/Qwen3.5-0.8B-decision をHugging Faceで公開しました。ベンチマーク独自の400件のテスト分割で、Accuracyは0.512です。

何が新しいか

このモデルは optiq lora train --decision で学習しており、backboneへのLoRAと新しいjoint schema headで構成します。noul、choice、scoreの3種類の質問を1回の処理(one pass)でスコアリングします。ライセンスはapache-2.0です。

QwenはAlibaba Cloudが開発する大規模言語モデルのファミリーで、MLXはAppleの機械学習研究チームが開発するAppleシリコン向けの配列計算フレームワークです。

Typed Decisionsでの評価結果

評価にはベンチマーク独自のfull 400-case test splitと、ベンチマーク自身の指標を使っています。

指標 値
Accuracy 0.512
KL from gold(低いほど良い) 0.3892
Brier(低いほど良い) 0.2094
ECE(低いほど良い) 0.1765

学習データはベンチマーク独自のtrain splitの1,080 recordsだけです。原文はこれをsmall-data resultと位置づけ、Clef modelsははるかに多くのデータで学習したと説明しています。

試し方・要件

Apple Silicon上でMLXとOptiQを使って実行します。起動コマンドは次のとおりです。

optiq serve --model mlx-community/

optiq serve は /v1/systemone エンドポイントを公開します。ディスク上のサイズは1.8 GBで、内訳はbf16 backbone、LoRA adapter、headです。学習とスコアリングにもOptiQを使っています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内