AI研究検索・リサーチ確認済み

arXiv論文:AIの論文新規性評価、正しい判定でも根拠の70%超が理由を支えず——NovGauge

18モデルを細かく検査し、表面的な正解率だけでは査読AIの根拠の弱さを見落とすと報告しました。

  • 2026-09-13
  • 最終確認日 2026-09-13
自分にどう関係する?

AIによる査読支援は、判定の正しさだけでなく、その根拠が本当に主張を支えるかを人が確認すべきだと示します。

ニュースをやさしく解説

結論から言うと、AIに論文の「新しさ」を判定させると、結論が正しくても、示した根拠がその理由を支えていないことが多いと分かりました。2026年9月10日にarXivへ公開された研究は、新規性評価を課題、問題、方法の3面に分けて診断するベンチマーク「NovGauge」を提案しました。

材料は、ICLR査読者が指摘した研究の重なりと、サーベイ論文で一緒に引用された研究から作った619組の論文ペアと50件の複数論文セットです。18種類の大規模言語モデルを評価したところ、存在しない内容などを根拠にする幻覚率は観点によって0〜39%でした。

さらに、幻覚ではなく結論も正しい「似ている」という判定に限っても、引用した証拠の70%超が述べた理由を論理的に支えていませんでした。最良だったGPT-5.5でも、根拠まで検証したF1は観点別に43〜72%で、多くのモデルは通常のF1から半分未満しか残りませんでした。

研究者や査読者がAIを使うなら、類似論文の候補探しには活用できても、新規性の最終判断を任せず、引用箇所と比較軸を人が読み直す必要があります。ただしこれはarXivプレプリントで、評価対象とデータ源はAI研究分野が中心です。すべての学問分野や査読手順に同じ数字が当てはまるとは限りません。出典は論文要旨と本文です。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXivプレプリントを開く