MiMo-V2.6開発チームは、omni-modalモデルファミリー「MiMo-V2.6」シリーズの研究報告を公開し、1ステップあたり1,568サンプル・2.7〜3.7Bトークンを最大1Mコンテキストで消費する非同期RL訓練の手法とインフラを示しました。チームは訓練ダイナミクス、RL環境、RLフレームワークをオープンソース化しています。
何が新しいか
報告は、RL計算を次の3方向で拡大することでモデル知能と自己改善を高めるとしています。
- バッチサイズとスループット: 大きなバッチと高スループットによる非同期訓練
- 環境の多様性・複雑性: code、general、visual、cyberの4領域を、複数のagent harnessを混合した環境として使用
- grader計算量: groupwise agentic gradingにより長期タスクでより正確な報酬信号を生成し、より短くトークン効率の高い解へモデルを誘導
RLの前段として、チームは広範なマルチモーダルコーパスでmid-trainingを行い探索空間を確保し、pretrained hybrid-SWA architecture上にスケールアップ用のインフラを構築しています。
RL訓練の数値と安定化策
| 項目 | 値 |
|---|---|
| 1ステップのサンプル数 | 1,568 samples |
| 1ステップのトークン数 | 2.7-3.7B tokens |
| 最大コンテキスト長 | up to 1M |
| RL環境の領域 | code / general / visual / cyber |
| 報酬評価 | groupwise agentic grading |
大規模化した訓練を安定させるため、チームはMoE routerをfreezeし、reward hackingに対する多層防御を構築しました。
インフラと公開物
mixed-task agentic RL向けの基盤として、チームは以下を備えたインフラを構築しています。
- 統一trajectory表現
- 高並行・マルチフレームワークrollout
- 制御プレーンとデータプレーンの分離
- training-inference consistency
オープンソース化した訓練ダイナミクス、RL環境、RLフレームワークは、大規模RLとモデルの自己改善に関する再現と追加研究を目的としています。

まだコメントはありません。