AI研究検索・リサーチ確認済み

arXiv論文:物理AIの誤答を専門家が再採点、GPT-5.6-Solは47.3%から78.7%へ

最先端AIの物理力を測る既存ベンチマークには、採点ミスや誤った模範解答が多く、性能を過小評価していた可能性があります。

  • 2026-09-14
  • 最終確認日 2026-09-14
自分にどう関係する?

AIランキングの点数は採点方法で大きく変わります。導入判断では、自分の用途に近い問題と人の確認を組み合わせることが重要です。

ニュースをやさしく解説

結論から言うと、最先端AIの物理問題への弱さは、AIそのものだけでなく、問題集や自動採点の不備によって大きく見えていた可能性がある。研究チームは2026年9月11日にarXivへ論文を投稿し、物理分野で広く使われる6つのベンチマークを、各分野の教員と大学院研究者が再点検した。対象は、答えを客観的に確認できる文章問題である。

専門家は問題文、模範解答、AIの回答を一つずつ読み、AIの本当の誤りと、採点器の誤判定、模範解答の誤り、条件不足で答えが定まらない問題を分けた。その結果、当初「不正解」とされた監査対象の多くは、AIの物理推論ではなく評価側の問題だった。

誤りを直すか不適切な設問を除くと、GPT-5.6-Solのmean@4はHLE-Physicsで47.3%から78.7%、CMT-Benchmarkで61.0%から87.2%へ上昇した。残した54問のCritPtではpass@4が94.4%に達した。利用者にとっては、ベンチマーク順位をそのまま「仕事で使える能力」と考えず、問題と採点方法まで見る必要があるという教訓だ。

一方、これは正解が確認しやすい閉じた問題での結果で、実験計画や新発見まで証明したわけではない。出典は査読会議の採択表記がないarXivプレプリントであり、今後の検証も必要である。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(プレプリント)を開く