Xiaomi、MiMo-V2.6-Flash-MOPDを公開 309B MoEでツール呼び出し反復を軽減

スペック

総パラメータ309B
活性パラメータ15B
コンテキスト長1M tokens
ライセンスMIT
4bit量子化の目安メモリ約185.4GB(256GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

XiaomiMiMoは、総309B・活性15BのSparse MoEモデルMiMo-V2.6-Flash-MOPDをMITライセンスで公開しました。MiMo-V2.6-Flash-RLチェックポイントにMOPD2を適用した版で、MiMo-V2.6で目立っていたツール呼び出しの反復を軽減しています。

何が新しいか

MOPD2は、複数のドメイン特化教師モデルを学生モデルへオンポリシー蒸留する手法です。教師は2系統あり、検証可能なタスクで学習したmixRL教師と、信頼できる報酬を設計しにくいオープンドメイン向けに合成デモで学習したSFT教師を使います。原文は、長期的なゲーム開発、科学研究、embodied intelligenceのように学習時の検証が難しい領域へ広げる狙いを挙げています。

1回の更新には次の3ストリームが寄与します。

  • Standard MOPD: mixRL教師が自律的なロールアウト全体を監督します。
  • Teacher-Prefix OPD: 教師のロールアウトを接頭辞にします。k個のアシスタントターンを持つ軌跡からk個の履歴接頭辞を作り、モデルが各接頭辞から1ターンを生成し、教師が同じ履歴に対して採点します。
  • SFT-Prefix OPD: SFTデモを履歴として与え、モデルが続きを書きます。

ツール呼び出しの反復は、同一または類似したツール呼び出しを繰り返し、時間とコンテキストを消費しながら進展しない問題です。明示的なエラーにならないため見落とされやすいと原文は説明しています。XiaomiMiMoは、短い特化教師の学習を通常のMOPDパスに組み込むことで対処しました。原文の図は、RL段階版と本チェックポイントの応答単位の反復率を、コンテキスト長とエージェントハーネスごとに比較しています。

アーキテクチャ

対応モダリティはText、Image、Video、Audioで、コンテキスト長は1Mトークンです。LLMバックボーンはSWAとGAを組み合わせたハイブリッド構成です。

項目 値
レイヤー数(Total / SWA / GA) 48 / 39 / 9
Hidden Size 4096
SWA Heads(Q/KV) 64 / 8
GA Heads(Q/KV) 64 / 4
Head Dimensions(QK / V) 192 / 128
Sliding Window Size 128
Routed Experts(Total / Activated) 256 / 8
ビジョンエンコーダー 681M MiMo ViT(28層: 24 SWA + 4 Full)
オーディオ 308M AudioTokenizer + 127M audio patch encoder
MTP 5層のスペキュレーティブデコーダー

入手方法

重みはHugging Face(XiaomiMiMo/MiMo-V2.6-Flash-MOPD)とModelScopeからダウンロードできます。Hugging Faceはモデルの重みやデータセットを共有するHugging Face Hubを提供する企業です。同シリーズとしてMiMo-V2.6-Pro-RL、MiMo-V2.6-Flash-RL、MiMo-V2.6-Pro-MOPDも同じ2か所で配布されています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内