SciCode-Verified(AI研究)検索・リサーチ確認済み

arXiv論文:科学コードAIの低得点はテスト側の欠陥が原因——65課題を修正すると正答率84〜98%

SciCode全65課題を専門家が監査し263件の欠陥を報告。修正版では12モデルの小課題正答率が45〜60%から84〜98%へ上昇した。

  • 2026-08-06
  • 最終確認日 2026-08-06
自分にどう関係する?

AIの順位や進歩を判断するとき、モデルの点数だけでなく、評価問題そのものが正しく作られているか確認する大切さが分かります。

ニュースをやさしく解説

結論から言うと、科学計算コードを作るAIの実力が頭打ちに見えた原因は、モデルだけでなく、評価問題と採点方法の欠陥にもあった可能性が高い。2026年8月5日にarXivへ提出された未査読論文は、物理や数学の理論を実装させる評価「SciCode」の全65問を分野の専門家が監査した。

監査では263件の欠陥を見つけ、このうち192件は主問題の91%に分布し、指示に沿った正しい解答を誤って不正解にする要因だったという。例は、再現できない模範解答、厳しすぎる数値誤差の許容範囲、互いに矛盾する課題文。得点を下げる欠陥の78%は、単なる誤字確認ではなく専門的な物理・数学知識が必要だった。

著者らは確認できた欠陥を直し、別の専門家による再確認を経た「SciCode-Verified」を作成。最先端モデル12版を再評価すると、小課題の正答率は従来の45〜60%から84〜98%へ、主問題は9〜27%から69〜92%へ上がった。利用者には、AIランキングを1つの点数だけで信じず、問題文、正解、採点器の品質まで見る教訓になる。

ただし修正版と監査結果も著者側の査読前報告で、モデルの科学的理解や実務での安全性を直接証明するものではない。公開された変更履歴を第三者が再検証する必要がある。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(未査読プレプリント)を開く