XiaomiMiMoは、総309B・活性15BのSparse MoEモデルMiMo-V2.6-Flash-MOPDをMITライセンスで公開しました。MiMo-V2.6-Flash-RLチェックポイントにMOPD2を適用した版で、MiMo-V2.6で目立っていたツール呼び出しの反復を軽減しています。
何が新しいか
MOPD2は、複数のドメイン特化教師モデルを学生モデルへオンポリシー蒸留する手法です。教師は2系統あり、検証可能なタスクで学習したmixRL教師と、信頼できる報酬を設計しにくいオープンドメイン向けに合成デモで学習したSFT教師を使います。原文は、長期的なゲーム開発、科学研究、embodied intelligenceのように学習時の検証が難しい領域へ広げる狙いを挙げています。
1回の更新には次の3ストリームが寄与します。
- Standard MOPD: mixRL教師が自律的なロールアウト全体を監督します。
- Teacher-Prefix OPD: 教師のロールアウトを接頭辞にします。k個のアシスタントターンを持つ軌跡からk個の履歴接頭辞を作り、モデルが各接頭辞から1ターンを生成し、教師が同じ履歴に対して採点します。
- SFT-Prefix OPD: SFTデモを履歴として与え、モデルが続きを書きます。
ツール呼び出しの反復は、同一または類似したツール呼び出しを繰り返し、時間とコンテキストを消費しながら進展しない問題です。明示的なエラーにならないため見落とされやすいと原文は説明しています。XiaomiMiMoは、短い特化教師の学習を通常のMOPDパスに組み込むことで対処しました。原文の図は、RL段階版と本チェックポイントの応答単位の反復率を、コンテキスト長とエージェントハーネスごとに比較しています。
アーキテクチャ
対応モダリティはText、Image、Video、Audioで、コンテキスト長は1Mトークンです。LLMバックボーンはSWAとGAを組み合わせたハイブリッド構成です。
| 項目 | 値 |
|---|---|
| レイヤー数(Total / SWA / GA) | 48 / 39 / 9 |
| Hidden Size | 4096 |
| SWA Heads(Q/KV) | 64 / 8 |
| GA Heads(Q/KV) | 64 / 4 |
| Head Dimensions(QK / V) | 192 / 128 |
| Sliding Window Size | 128 |
| Routed Experts(Total / Activated) | 256 / 8 |
| ビジョンエンコーダー | 681M MiMo ViT(28層: 24 SWA + 4 Full) |
| オーディオ | 308M AudioTokenizer + 127M audio patch encoder |
| MTP | 5層のスペキュレーティブデコーダー |
入手方法
重みはHugging Face(XiaomiMiMo/MiMo-V2.6-Flash-MOPD)とModelScopeからダウンロードできます。Hugging Faceはモデルの重みやデータセットを共有するHugging Face Hubを提供する企業です。同シリーズとしてMiMo-V2.6-Pro-RL、MiMo-V2.6-Flash-RL、MiMo-V2.6-Pro-MOPDも同じ2か所で配布されています。

まだコメントはありません。