Xiaomi、309B MoEのMiMo-V2.6-Flash-RLをMITで公開

スペック

総パラメータ309B
活性パラメータ15B
コンテキスト長1M tokens
ライセンスmit
重みの公開HuggingFaceおよびModelScopeでダウンロード可能
4bit量子化の目安メモリ約185.4GB(256GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

XiaomiMiMoは、総パラメータ309B・活性15BのSparse MoEモデル「MiMo-V2.6-Flash-RL」をMITライセンスで公開しました。1Mトークンのコンテキスト長を持ち、テキスト・画像・動画・音声を1つのモデルで扱い、DeepSWE v1.1で67.9を記録しています。

何が新しいか

MiMo-V2.6-Flash-RLは、MiMo-V2.6シリーズのうち効率とのバランスを取ったチェックポイントです。上位版のMiMo-V2.6-Pro-RLも同時に配布されています。XiaomiMiMoは、コーディング、一般エージェント、ビジュアル、サイバーセキュリティを領域ごとに分けず、単一の混合強化学習("You Only RL Once")で学習させました。同じバッチにタスクと複数のハーネスを混ぜ、学習時に見ていないハーネスへも戦略が転移することを狙っています。

学習手法の要点は以下のとおりです。

  • 完全非同期のGRPOを1ステップあたり1,568プロンプト×16ロールアウトの大バッチで実行
  • エージェント型グレーダーがグループ内のロールアウトを比較。Groupwise Reward Synthesis(GRS)が対照的なロールアウトからタスク別ルーブリックをオフラインで作り、テスト結果と融合。Groupwise Advantage Redistribution(GAR)が合格した軌跡をオンラインで順位付けし、より高品質な解へadvantageを寄せる
  • 自己修正からのコールドスタートと、環境のハードニングや検証器のクロスチェックによるreward hacking対策
  • 混合RL後にMulti-Prefix Multi-Teacher On-Policy Distillation(MOPD2)を適用し、検証が難しいタスクへ能力を拡張

仕様

Vision Encoderは681MパラメータのMiMo ViT(28層: 24 SWA + 4 Full)、音声側は308MのAudioTokenizerと127Mのaudio patch encoderで構成されています。Multi-Token Prediction(MTP)として5層のspeculative decoderを備えます。

ベンチマーク

ベンチマーク MiMo-V2.6 Flash MiMo-V2.6 Pro Claude Opus 5 GPT-5.6 Sol
DeepSWE v1.1 67.9 71.9 74.0 73.0
ProgramBench 26.0 26.5 37.0 25.0
MiMo Code Bench 61.2 63.2 68.6 59.3
AutomationBench v1.0.6 52.3 53.1 50.3 45.8
Toolathlon-Verified 73.6 76.9 80.6 74.9
Agents’ Last Exam 27.6 31.6 31.6 30.8
Terminal Bench 2.1 87.6 89.9 89.1 88.8
OSWorld-Verified 80.8 82.0 83.4 83.0
CyberGym 95.1 94.0 - -

数値はXiaomiMiMoのモデルカードに掲載された値です。

入手方法

重みはHugging FaceのXiaomiMiMo/MiMo-V2.6-Flash-RLと、ModelScopeの同名リポジトリからダウンロードできます。Hugging Faceはモデルの重みやデータセットを共有するHugging Face Hubを提供する企業です。ほかにXiaomi MiMo API Platform、Xiaomi MiMo Studio、Xiaomi MiMo Desktopも案内されています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内