arXiv論文:科学コードAIの低得点はテスト側の欠陥が原因——65課題を修正すると正答率84〜98%
SciCode全65課題を専門家が監査し263件の欠陥を報告。修正版では12モデルの小課題正答率が45〜60%から84〜98%へ上昇した。
AIの順位や進歩を判断するとき、モデルの点数だけでなく、評価問題そのものが正しく作られているか確認する大切さが分かります。
ニュースをやさしく解説
結論から言うと、科学計算コードを作るAIの実力が頭打ちに見えた原因は、モデルだけでなく、評価問題と採点方法の欠陥にもあった可能性が高い。2026年8月5日にarXivへ提出された未査読論文は、物理や数学の理論を実装させる評価「SciCode」の全65問を分野の専門家が監査した。
監査では263件の欠陥を見つけ、このうち192件は主問題の91%に分布し、指示に沿った正しい解答を誤って不正解にする要因だったという。例は、再現できない模範解答、厳しすぎる数値誤差の許容範囲、互いに矛盾する課題文。得点を下げる欠陥の78%は、単なる誤字確認ではなく専門的な物理・数学知識が必要だった。
著者らは確認できた欠陥を直し、別の専門家による再確認を経た「SciCode-Verified」を作成。最先端モデル12版を再評価すると、小課題の正答率は従来の45〜60%から84〜98%へ、主問題は9〜27%から69〜92%へ上がった。利用者には、AIランキングを1つの点数だけで信じず、問題文、正解、採点器の品質まで見る教訓になる。
ただし修正版と監査結果も著者側の査読前報告で、モデルの科学的理解や実務での安全性を直接証明するものではない。公開された変更履歴を第三者が再検証する必要がある。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。