AI研究検索・リサーチ確認済み

arXiv論文:科学図表を読むAI、正答率より証拠回収率が20ポイント超低い——Sci-MMR

4分野235課題で先端AI8種を調べ、答えが合っていても必要な図表証拠をそろえられない問題を示しました。

  • 2026-09-13
  • 最終確認日 2026-09-13
自分にどう関係する?

調査AIの答えが正しく見えても、根拠の図表を取り違えている可能性があり、引用箇所まで確認する必要があります。

ニュースをやさしく解説

結論から言うと、科学論文を調べるAIは最終回答が合っていても、その結論を支える図表の証拠を十分に集められていない場合があります。2026年9月10日にarXivへ公開された研究は、科学的主張、引用知識、図表、根拠となる画像領域を結び付けた評価基準「Sci-MMR」を提案しました。

データは4つの科学分野にまたがる235件の多段階推論課題で、1課題には平均9枚の図表パネルが含まれます。先端の画像対応AI8種を評価すると、最終回答の正答率は、必要な証拠を完全に回収できた割合より一貫して20ポイント超高く、答えだけを見る試験が実力を過大評価する可能性が分かりました。

失敗の57.2%は図表から完全な証拠を取り出す段階で起き、画像の切り抜き機能を使っても改善は4.5ポイントでした。一方、正しい証拠を先に与えると正答率は最大37.0ポイント上がりました。それでも最難関課題では最良モデルが69.1%にとどまり、証拠を結論へ組み立てる失敗も31.8%ありました。

利用者は深掘り調査AIの答えだけでなく、引用した図のどの部分が結論を支えるかまで確認する必要があります。ただしこれはarXiv上のプレプリントで、235課題の結果を科学研究全体へそのまま広げることはできません。出典は論文要旨と本文です。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXivプレプリントを開く