MiMo-V2.6、1Mコンテキストで1ステップ最大3.7BトークンのRL訓練を公開

スペック

コンテキスト長up to 1M

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

MiMo-V2.6開発チームは、omni-modalモデルファミリー「MiMo-V2.6」シリーズの研究報告を公開し、1ステップあたり1,568サンプル・2.7〜3.7Bトークンを最大1Mコンテキストで消費する非同期RL訓練の手法とインフラを示しました。チームは訓練ダイナミクス、RL環境、RLフレームワークをオープンソース化しています。

何が新しいか

報告は、RL計算を次の3方向で拡大することでモデル知能と自己改善を高めるとしています。

  1. バッチサイズとスループット: 大きなバッチと高スループットによる非同期訓練
  2. 環境の多様性・複雑性: code、general、visual、cyberの4領域を、複数のagent harnessを混合した環境として使用
  3. grader計算量: groupwise agentic gradingにより長期タスクでより正確な報酬信号を生成し、より短くトークン効率の高い解へモデルを誘導

RLの前段として、チームは広範なマルチモーダルコーパスでmid-trainingを行い探索空間を確保し、pretrained hybrid-SWA architecture上にスケールアップ用のインフラを構築しています。

RL訓練の数値と安定化策

項目 値
1ステップのサンプル数 1,568 samples
1ステップのトークン数 2.7-3.7B tokens
最大コンテキスト長 up to 1M
RL環境の領域 code / general / visual / cyber
報酬評価 groupwise agentic grading

大規模化した訓練を安定させるため、チームはMoE routerをfreezeし、reward hackingに対する多層防御を構築しました。

インフラと公開物

mixed-task agentic RL向けの基盤として、チームは以下を備えたインフラを構築しています。

  • 統一trajectory表現
  • 高並行・マルチフレームワークrollout
  • 制御プレーンとデータプレーンの分離
  • training-inference consistency

オープンソース化した訓練ダイナミクス、RL環境、RLフレームワークは、大規模RLとモデルの自己改善に関する再現と追加研究を目的としています。

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内