Ali Ansari、Haoran Sun、Andy Zeyi Liu、John Sousらは2026年9月11日、物理ベンチマーク6件を専門家が監査・再採点した論文をarXiv(arXiv:2609.13009 [cs.AI])で公開しました。採点ミスや誤った参照解答を修正した結果、HLE-PhysicsにおけるGPT-5.6-Solのmean@4は47.3%から78.7%へ上昇しています。GPTはOpenAIが開発するAIモデルのファミリーで、文章やコード、数式などを生成し、推論を行うモデルも含まれます。
何が新しいか
研究チームは、HLE-Physics、CMT-Benchmark、UGPhysics、PRISM-Physics、PHYBench、CritPtの6つの物理ベンチマークを対象に、検証可能な最終解答を持つテキストのみの問題に絞って評価を行いました。物理の各分野について、関連する専門知識を持つ教員および大学院研究者が問題文、参照解答、モデル回答を精査し、モデル自身の誤りと、採点ミス、誤った参照解答、曖昧または条件不足の問題を区別しています。
当初「不正解」と判定されていた監査対象ケースの大半は、モデルの物理推論の誤りではなく、ベンチマーク側の問題に起因していました。そこで専門家が誤った参照解答を修正し、欠陥のある問題を修復または除外したうえで再採点しています。
修正前後のスコア
修正後のスコアは、専門家レビュー後に保持された評価サブセットに対して算出されています。
| ベンチマーク | 指標 | 修正前 | 修正後 |
|---|---|---|---|
| HLE-Physics | mean@4 |
47.3% | 78.7% |
| CMT-Benchmark | mean@4 |
61.0% | 87.2% |
| CritPt(保持された54課題) | pass@4 |
— | 94.4% |
UGPhysics、PRISM-Physics、PHYBenchの監査対象サブセットでも、修正後のスコアは大幅に上昇したとしています。
読み方と論文の入手
著者らは、現行のベンチマークが、適切に設定された物理問題を解くフロンティアモデルの能力を大幅に過小評価していると論じています。あわせて、こうした閉じた形式の課題では性能が飽和に近づいており、より難しく専門家が検証した評価が必要だと指摘しています。低いスコアが報告されてきた背景として、Artificial Analysis Intelligence Index(2026)に採用されたベンチマークを含む結果が、専門家自身が業務でモデルを使う際の実感と一致しない点を挙げています。
論文はarXiv:2609.13009でPDF、実験的HTML、TeX Sourceとして閲覧できます。Hacker Newsでは81ポイント・42コメントが付いています。

まだコメントはありません。