arXivで公開された論文は、WindowsとOllama向けのローカル優先エージェント・ハーネス「Mingbird」を提案し、4ハーネス×4オープンモデル×18実タスクの比較ベンチマークLRABで総合0.886(goose 0.631、opencode 0.479、agent-mini 0.405)を報告しました。著者らは、小規模オープンウェイトモデルの失敗の相当部分がモデルではなくハーネスに起因すると主張しています。
Ollamaは、オープンなAIモデルを実行・管理するツールで、REST APIやPython・JavaScriptのライブラリから呼び出せ、コーディングエージェントとの接続機能も備えます。
何が新しいか
論文によると、2〜9Bの小規模オープンウェイトモデルは普通のノートPCで動く一方、クラウド規模のエージェント・ハーネス上では実タスクをほとんど完了できません。原因として次の失敗形態を挙げています。
- ツールのプレフィルによるコンテキスト超過
- 自己修正の発散
- ツール実演のループ
- タスクの無言放棄
Mingbirdはこれらを個別に補う10の機構を備え、代表的なものとして次の3つを示しています。
- バイトレベルのネットゼロ・プレフィル予算
- 完了を受け入れる前にタスクを再読するfinish gate
- 署名レベルのループ検出
ベンチマーク結果
LRABはマシン、モデル、予算、スコアリングを固定し、決定論的な成果物スコアリングで比較します。対象モデルは2B〜35Bの4種で、全288セルの結果を公開しています。
| 評価 | 条件 | Mingbird | 比較対象 |
|---|---|---|---|
| LRAB総合 | 4ハーネス×4モデル×18タスク | 0.886 | goose 0.631 / opencode 0.479 / agent-mini 0.405 |
| τ²-bench | 278タスク、3アーム、1プロトコル | 0.856 | 0.791 / 0.737 |
| フロンティアモデル調査 | 同じ18タスク | ハーネス間で0.997〜0.478 | 整形式スキャフォールド同士は0.072以内 |
アブレーションと限界
機構を1つずつ外すleave-one-mechanism-outアブレーションは、方向性のみの報告としています。同一アームを同じ夜に再現すると平均が最大0.069動き、これは各単回試行の名目上の差分と同じ大きさだからです。唯一のバッチ一致比較(フル機構スタック対テキスト再読のみ)では、実行可能な完了ガードが3回の再現で対応ありの+0.10を示しました。
著者らは証拠の限界として、自作ベンチマーク、単一マシン、単回試行スコアリングの3点を明記しています。

まだコメントはありません。