AI研究検索・リサーチ確認済み

arXiv論文:自然な一文で判断AIの答えが反転——4システムで狙った誤答率61.4〜73.2%

質問の正解を変えない自然な背景文を足すだけで、選択や振り分けを行うAIが高い割合で狙った誤答へ誘導されました。

  • 2026-09-26
  • 最終確認日 2026-09-26
自分にどう関係する?

高い確信度を出すAIでも周辺文で判断が変わるため、自動振り分けや操作実行には別の確認層が必要だと示します。

ニュースをやさしく解説

結論から言うと、依頼の振り分けや道具選択を担うAIは、正解と関係のない自然な背景文だけで判断を変える恐れがあります。2026年9月24日にarXivへ投稿された論文「JevOut: Natural Context Can Flip Decision Models」は、文章を有限個の選択肢の確率へ変換する判断モデルを調べました。

研究では、最初は正解できた問題ごとに狙う誤答を一つ決め、元の資料、質問、選択肢、正解は変えず、会話になじむ短い文脈だけを加えました。Jevでは、各問題につき最大64回の評価内で、当初正解した508件のうち312件、61.4%が狙った誤答へ反転しました。そのうち229件では、誤答への確率が0.7以上になりました。

別の3つの判断システムも、7種類のデータセットで64.9〜73.2%の狙った反転率を示しました。問い合わせを部署へ送る、使う道具を決める、後続処理を起動するといった用途では、AIの確率が高いだけで安全と考えないことが大切です。重要操作には入力文と無関係な背景を分離し、許可規則や人の承認を重ねる必要があります。

ただしこれは研究者がモデルの確率を見ながら文を最適化した攻撃評価で、普通の文章が常に同率で失敗を起こす意味ではありません。掲載先は査読前研究も含むarXivで、数値は論文の実験条件に限られます。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXivを開く