Microsoftは2026年9月22日、リポジトリレベルのコーディングエージェントモデルFrogNano-4B-2609をHugging Faceで公開しました。Qwen/Qwen3.5-4Bを基盤に、約1,500件の合成ソフトウェア工学タスクで強化学習のみの追加学習を行ったモデルです。
QwenはAlibaba Cloudが開発する大規模言語モデルのファミリーです。
何が新しいか
FrogNanoは、TaskPilotで生成・検証し、学習中のポリシーに合わせて調整した約1,500件の合成SWEタスク環境を使い、強化学習だけで追加学習しています。報酬は、5ツール構成のLeafハーネス上で実行する複数ターンのコーディング軌跡全体に対する、実行可能なテストに基づくものです。行動蒸留型の手法と異なり、より強いモデルの解答軌跡、行動、推論トレース、パッチ目標は学習に使っていません。
対象とする能力は、長期的なリポジトリのナビゲーション、ファイル横断のコード理解、デバッグ、コード編集、テスト実行、コマンドとテストのフィードバックを使った複数ファイルのパッチの反復生成です。
仕様
アーキテクチャはQwen3.5-4Bから継承した32層の密なハイブリッドGated DeltaNet/gated-attention構成です。評価時の結合コンテキスト長は生成分を含めて約131K tokensで、検証済み構成ではアシスタント1ターンあたり最大8,192 tokensを生成できます。学習期間は2026年6月〜8月、ライセンスはApache License 2.0です。
入力はテキストのみ(自然言語の指示、ソースコード、テキスト形式のツール出力)を対象とします。上流チェックポイントには画像・動画入力のコンポーネントが残っていますが、FrogNanoはこれらを追加学習・評価しておらず、対応を主張していません。
試し方・利用条件
- FrogNanoはLeafハーネスと統合して使います。Leafはモデルが生成した構造化ツール呼び出しのうち認可されたものを、隔離されたリポジトリ環境で実行します。
- ハーネスはファイルの検査・検索、コード編集、シェルコマンド実行、テスト実行を行い、候補パッチを生成します。FrogNano自体は変更をデプロイしません。
- 入力には、認可されたリポジトリのスナップショットと英語の自然言語による課題を与えます。
- 候補パッチは提案であり、利用・デプロイ前に人間によるレビュー、回帰テスト、セキュリティ検証が必要です。
- 主な用途はソフトウェア工学研究と人間監督下の開発です。
制約
Microsoftは、性能がLeafハーネスとテストの品質に左右されること、学習データがPython中心かつ主に英語であること、生成パッチは既存テストを通過しても誤りや脆弱性を含みうることを挙げています。FrogNano固有の追加学習では安全性選好、拒否、有害コンテンツ、敵対的データセットを使っておらず、Microsoftは無制限の自律デプロイに向けて独立に安全性アライメントされたモデルとみなすべきではないとしています。

まだコメントはありません。