Mingbird、小型モデル向けハーネスでLRAB総合0.886を記録

arXivで公開された論文は、WindowsとOllama向けのローカル優先エージェント・ハーネス「Mingbird」を提案し、4ハーネス×4オープンモデル×18実タスクの比較ベンチマークLRABで総合0.886(goose 0.631、opencode 0.479、agent-mini 0.405)を報告しました。著者らは、小規模オープンウェイトモデルの失敗の相当部分がモデルではなくハーネスに起因すると主張しています。

Ollamaは、オープンなAIモデルを実行・管理するツールで、REST APIやPython・JavaScriptのライブラリから呼び出せ、コーディングエージェントとの接続機能も備えます。

何が新しいか

論文によると、2〜9Bの小規模オープンウェイトモデルは普通のノートPCで動く一方、クラウド規模のエージェント・ハーネス上では実タスクをほとんど完了できません。原因として次の失敗形態を挙げています。

  • ツールのプレフィルによるコンテキスト超過
  • 自己修正の発散
  • ツール実演のループ
  • タスクの無言放棄

Mingbirdはこれらを個別に補う10の機構を備え、代表的なものとして次の3つを示しています。

  • バイトレベルのネットゼロ・プレフィル予算
  • 完了を受け入れる前にタスクを再読するfinish gate
  • 署名レベルのループ検出

ベンチマーク結果

LRABはマシン、モデル、予算、スコアリングを固定し、決定論的な成果物スコアリングで比較します。対象モデルは2B〜35Bの4種で、全288セルの結果を公開しています。

評価 条件 Mingbird 比較対象
LRAB総合 4ハーネス×4モデル×18タスク 0.886 goose 0.631 / opencode 0.479 / agent-mini 0.405
τ²-bench 278タスク、3アーム、1プロトコル 0.856 0.791 / 0.737
フロンティアモデル調査 同じ18タスク ハーネス間で0.997〜0.478 整形式スキャフォールド同士は0.072以内

アブレーションと限界

機構を1つずつ外すleave-one-mechanism-outアブレーションは、方向性のみの報告としています。同一アームを同じ夜に再現すると平均が最大0.069動き、これは各単回試行の名目上の差分と同じ大きさだからです。唯一のバッチ一致比較(フル機構スタック対テキスト再読のみ)では、実行可能な完了ガードが3回の再現で対応ありの+0.10を示しました。

著者らは証拠の限界として、自作ベンチマーク、単一マシン、単回試行スコアリングの3点を明記しています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内