AI研究検索・リサーチ確認済み
arXiv論文:科学図表を読むAI、正答率より証拠回収率が20ポイント超低い——Sci-MMR
4分野235課題で先端AI8種を調べ、答えが合っていても必要な図表証拠をそろえられない問題を示しました。
自分にどう関係する?
調査AIの答えが正しく見えても、根拠の図表を取り違えている可能性があり、引用箇所まで確認する必要があります。
ニュースをやさしく解説
結論から言うと、科学論文を調べるAIは最終回答が合っていても、その結論を支える図表の証拠を十分に集められていない場合があります。2026年9月10日にarXivへ公開された研究は、科学的主張、引用知識、図表、根拠となる画像領域を結び付けた評価基準「Sci-MMR」を提案しました。
データは4つの科学分野にまたがる235件の多段階推論課題で、1課題には平均9枚の図表パネルが含まれます。先端の画像対応AI8種を評価すると、最終回答の正答率は、必要な証拠を完全に回収できた割合より一貫して20ポイント超高く、答えだけを見る試験が実力を過大評価する可能性が分かりました。
失敗の57.2%は図表から完全な証拠を取り出す段階で起き、画像の切り抜き機能を使っても改善は4.5ポイントでした。一方、正しい証拠を先に与えると正答率は最大37.0ポイント上がりました。それでも最難関課題では最良モデルが69.1%にとどまり、証拠を結論へ組み立てる失敗も31.8%ありました。
利用者は深掘り調査AIの答えだけでなく、引用した図のどの部分が結論を支えるかまで確認する必要があります。ただしこれはarXiv上のプレプリントで、235課題の結果を科学研究全体へそのまま広げることはできません。出典は論文要旨と本文です。
PR
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。
広告