arXivで公開された研究は、ローカルのオープンウェイトLLMエージェントが再現可能なデータエンジニアリング成果物を生成できるかを、モビリティワークフロー15課題・10構成・計1,500試行で評価しました。最も強い構成は成果物レベルで85.3%、量子化9Bモデルは約6.5 GBのメモリで69.3%の成功率に達しています。
何が新しいか
研究者は、従来の評価がテキスト応答や単独のコード生成を重視していた点を挙げ、この研究では完全なエンジニアリング成果物の正しさと再現性を評価対象にしています。生成されたスクリプト、テーブル、構造化ファイル、図、レポートを決定論的チェッカーで採点します。目的には、クローズドループのワークスペース条件の効果の定量化と、モデル規模、アーキテクチャ、量子化、ランタイム、ツール使用、失敗のトレードオフの検討も含まれます。
評価設計と結果
| 項目 | 値 |
|---|---|
| 課題数 | 15(モビリティワークフロー) |
| ローカル構成数 | 10 |
| 反復回数 | モデル・モード・課題ごとに5回 |
| 採点済み試行数 | 1,500 |
| 評価ハードウェア | consumer-grade GPU |
| ワークスペース条件による合格率の上昇(2B超のモデル) | 26.7〜52.0ポイント |
| 最強構成の成果物レベル成功率 | 85.3% |
| 量子化9Bモデルの成功率 | 69.3% |
| 量子化9Bモデルのメモリ使用量 | 約6.5 GB |
課題はデータ発見、コネクター、交通フィード処理、セマンティック・エンリッチメント、特徴量エンジニアリング、検証、可視化、レポート作成をカバーします。評価モードは、ワンショット生成と、エージェントが中間成果物を検査・修正できるクローズドループのワークスペース条件の2種類です。
意味
研究者によると、ワークスペース条件による改善は、中間成果物がエラーを露呈し、エージェントがそれを検査・修正できる場合に最大になります。結論として、ローカルのオープンウェイトエージェントはソフトウェア集約型データエンジニアリング作業の一部を支援できる一方、信頼性はモデル能力、タスクの検証可能性、決定論的検証に依存するとしています。研究者はこのベンチマークを、エンジニアリングワークフローへの導入前にエージェント構成全体を再現可能に評価する方法として位置づけています。

まだコメントはありません。