XiaomiMiMoは、総パラメータ309B・活性15BのSparse MoEモデル「MiMo-V2.6-Flash-RL」をMITライセンスで公開しました。1Mトークンのコンテキスト長を持ち、テキスト・画像・動画・音声を1つのモデルで扱い、DeepSWE v1.1で67.9を記録しています。
何が新しいか
MiMo-V2.6-Flash-RLは、MiMo-V2.6シリーズのうち効率とのバランスを取ったチェックポイントです。上位版のMiMo-V2.6-Pro-RLも同時に配布されています。XiaomiMiMoは、コーディング、一般エージェント、ビジュアル、サイバーセキュリティを領域ごとに分けず、単一の混合強化学習("You Only RL Once")で学習させました。同じバッチにタスクと複数のハーネスを混ぜ、学習時に見ていないハーネスへも戦略が転移することを狙っています。
学習手法の要点は以下のとおりです。
- 完全非同期のGRPOを1ステップあたり1,568プロンプト×16ロールアウトの大バッチで実行
- エージェント型グレーダーがグループ内のロールアウトを比較。Groupwise Reward Synthesis(GRS)が対照的なロールアウトからタスク別ルーブリックをオフラインで作り、テスト結果と融合。Groupwise Advantage Redistribution(GAR)が合格した軌跡をオンラインで順位付けし、より高品質な解へadvantageを寄せる
- 自己修正からのコールドスタートと、環境のハードニングや検証器のクロスチェックによるreward hacking対策
- 混合RL後にMulti-Prefix Multi-Teacher On-Policy Distillation(MOPD2)を適用し、検証が難しいタスクへ能力を拡張
仕様
Vision Encoderは681MパラメータのMiMo ViT(28層: 24 SWA + 4 Full)、音声側は308MのAudioTokenizerと127Mのaudio patch encoderで構成されています。Multi-Token Prediction(MTP)として5層のspeculative decoderを備えます。
ベンチマーク
| ベンチマーク | MiMo-V2.6 Flash | MiMo-V2.6 Pro | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| DeepSWE v1.1 | 67.9 | 71.9 | 74.0 | 73.0 |
| ProgramBench | 26.0 | 26.5 | 37.0 | 25.0 |
| MiMo Code Bench | 61.2 | 63.2 | 68.6 | 59.3 |
| AutomationBench v1.0.6 | 52.3 | 53.1 | 50.3 | 45.8 |
| Toolathlon-Verified | 73.6 | 76.9 | 80.6 | 74.9 |
| Agents’ Last Exam | 27.6 | 31.6 | 31.6 | 30.8 |
| Terminal Bench 2.1 | 87.6 | 89.9 | 89.1 | 88.8 |
| OSWorld-Verified | 80.8 | 82.0 | 83.4 | 83.0 |
| CyberGym | 95.1 | 94.0 | - | - |
数値はXiaomiMiMoのモデルカードに掲載された値です。
入手方法
重みはHugging FaceのXiaomiMiMo/MiMo-V2.6-Flash-RLと、ModelScopeの同名リポジトリからダウンロードできます。Hugging Faceはモデルの重みやデータセットを共有するHugging Face Hubを提供する企業です。ほかにXiaomi MiMo API Platform、Xiaomi MiMo Studio、Xiaomi MiMo Desktopも案内されています。

まだコメントはありません。