arXiv論文:物理AIの誤答を専門家が再採点、GPT-5.6-Solは47.3%から78.7%へ
最先端AIの物理力を測る既存ベンチマークには、採点ミスや誤った模範解答が多く、性能を過小評価していた可能性があります。
AIランキングの点数は採点方法で大きく変わります。導入判断では、自分の用途に近い問題と人の確認を組み合わせることが重要です。
ニュースをやさしく解説
結論から言うと、最先端AIの物理問題への弱さは、AIそのものだけでなく、問題集や自動採点の不備によって大きく見えていた可能性がある。研究チームは2026年9月11日にarXivへ論文を投稿し、物理分野で広く使われる6つのベンチマークを、各分野の教員と大学院研究者が再点検した。対象は、答えを客観的に確認できる文章問題である。
専門家は問題文、模範解答、AIの回答を一つずつ読み、AIの本当の誤りと、採点器の誤判定、模範解答の誤り、条件不足で答えが定まらない問題を分けた。その結果、当初「不正解」とされた監査対象の多くは、AIの物理推論ではなく評価側の問題だった。
誤りを直すか不適切な設問を除くと、GPT-5.6-Solのmean@4はHLE-Physicsで47.3%から78.7%、CMT-Benchmarkで61.0%から87.2%へ上昇した。残した54問のCritPtではpass@4が94.4%に達した。利用者にとっては、ベンチマーク順位をそのまま「仕事で使える能力」と考えず、問題と採点方法まで見る必要があるという教訓だ。
一方、これは正解が確認しやすい閉じた問題での結果で、実験計画や新発見まで証明したわけではない。出典は査読会議の採択表記がないarXivプレプリントであり、今後の検証も必要である。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。