AI研究検索・リサーチ確認済み

arXiv論文:同じAIでもWeb検索で正答率が最大8ポイント低下——同じ質問の回答も最大21%不一致

ChatGPTの画面とAPI、検索あり・なしを401問、4812回答で比較。単発の正答率だけでは実際の安全性を測り切れないと示した。

  • 2026-08-10
  • 最終確認日 2026-08-10
自分にどう関係する?

ベンチマーク点だけでAIを選ばず、自分が使う画面・検索設定で複数回試し、引用元まで確認する重要性が分かります。

ニュースをやさしく解説

結論から言うと、同じ系統のAIでも、チャット画面かAPIか、Web検索を使うか、同じ質問を何回試すかによって、安全性テストの結果が大きく変わるとする研究が出た。

2026年8月6日にarXivのcs.HCへ投稿された未査読論文「What Current AI Benchmarks Leave Unmeasured」は、ChatGPTの画面とOpenAI APIを、検索あり・なしで比較した。偏見を測るBBQと安全性を測るSafetyBenchから401問を選び、各条件で3回ずつ試して合計4812回答を集めた。

検索を切った条件では、両評価とも画面版の正答率がAPI版より低かった。Web検索を有効にすると正答率は最大8ポイント下がり、片方の評価では画面とAPIの優劣まで逆転した。同じ質問を繰り返しても、最大21%の質問で回答が一致せず、引用する情報源や回答を控える傾向にも差が出た。

利用者には、AIを選ぶ時に「モデル名と1回の点数」だけを信じず、実際に使う画面、検索設定、複数回の再現性、引用の中身まで確かめる必要があると分かる。ただし対象は1つのモデル系統と2つの評価に限られ、他社AIへ同じ差をそのまま当てはめられない。arXivで公開された査読前研究なので、追試と専門家の検証も必要だ。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(cs.HC、未査読)を開く