Reflectionは2026年10月5日、総パラメータ501B・アクティブ23BのsparseなMixture-of-Expertsモデル「Beam」を発表しました。同社初のオープンウェイトモデルで、SWEBench Verifiedで80.9、Terminal Bench v2.1で80.1を記録したとしています。
何が新しいか
Beamはコーディング、推論、エージェント用途向けに学習したモデルです。Reflectionは事前学習と大規模な強化学習(RL)を組み合わせ、オープンウェイトとして競争力のある性能と推論時の効率を両立したと説明しています。比較対象として、GLM 5.2のようなより大きなオープンモデルと競合し、コーディングとエージェントのタスクではQwen 3.8-Maxに迫るとしています。一方で、生の能力ではKimi K3などのフロンティアのオープンモデルが上回っており、Beamの強みは推論時の効率にあると位置づけています。モデルはtext-onlyですが、他モダリティの情報もテキストで表現されていれば扱えます。
学習規模と主なスコア
| 項目 | 値 |
|---|---|
| 事前学習トークン | 23.8T |
| RLのGPU | NVIDIA GB300 10.5K基 |
| RL期間 | 4週間 |
| ロールアウト数 | 1億超 |
| RL最大コンテキスト長 | 256K tokens |
| サンドボックス数 | 約13億 |
| 環境数 | 約100万 |
| SWEBench Verified | 80.9 |
| Terminal Bench v2.1 | 80.1 |
| AIME 2026 | 97.8 |
| GPQA Diamond | 90.5 |
| SWEBench Multilingual | 78.0 |
他モデルとの比較では、Terminal Bench v2.1でGLM 5.2が81.0、Kimi K3が88.3、HLE no toolsではBeamが36.2、GLM 5.2が40.5です。Reflectionは、高度な推論ベンチマークでGLM-5.2と同等程度のスコアを3〜4倍少ない推論計算量で達成したとしています。推論計算量は FLOPs ≈ 2 × active parameter count × mean generated tokens per attempt で推定しており、この推定にはprefill、コンテキスト依存のattention、サービングのオーバーヘッドを含めていません。
学習手法として、Reflectionは非同期policy gradientsを用い、新たな安定化アルゴリズムを導入しました。これにより、107ウェイトバージョン分、つまり1日分の遅れ(staleness)があっても数値的に安定して学習できたと述べています。あわせて、制御可能な長さペナルティも使っています。
提供条件と試し方
Beamは現在、最終的なred-teamingと評価の段階にあります。発表記事の登録ページからearly accessに申し込めます。重み、technical report、model card、developer artifactsは今月後半(later this month)に公開する予定です。推論時はreasoning effort parameterで挙動を調整でき、低い設定では短い応答を、高い設定では性能向上のための長い推論を優先します。
背景
GLMはZ.aiが開発するAIモデルのファミリーです。QwenはAlibaba Cloud、KimiはMoonshot AIがそれぞれ開発するモデルファミリーです。

まだコメントはありません。