arXiv論文:正しいAIも誤ったヒントで答えを変更——1000問×4条件、全モデルで弱点を確認
同じ問題に正しい・誤り・無関係の文脈を加えるMISTを公開。何でも無視せず必要な情報だけ信じる学習法SCOPEも提案した。
検索結果や資料に誤りが混ざると強いAIも答えを変えます。重要判断では引用元を開いて根拠を確認してください。
ニュースをやさしく解説
結論から言うと、AIが単独では正解できる問題でも、もっともらしい誤ったヒントを添えると答えを変えてしまい、逆に全ての外部情報を無視するだけでも役に立たないことを測る研究が出た。2026年8月6日にarXivのcs.CLへ投稿された未査読論文は、評価データ「MIST」と学習法「SCOPE」を提案した。
MISTは1000問を、追加情報なし、誤ったヒント、正しいヒント、関係はあるが答えに不要な情報という4条件にし、計4000行で比べる。800問は既存の数学・知識・推論評価を基にし、200問はSTEM分野の学位を持つ担当者が長い場面として作成し、別工程で正解、曖昧さ、情報漏れを確認した。
GPT-5.5は追加情報なしで96.0%正解したが、誤ったヒント付きでは86.1%へ低下し、元は正解だった問題が誤答へ変わる割合は10.5%。Gemini 3.1 ProやClaude、公開モデルを含む全モデルで低下が見られた。
SCOPEは4条件を同じ割合で学び、Qwen3-4Bでは誤答への反転率を35.0%から16.3%へ下げつつ、4条件平均を86.9%から92.0%へ上げた。検索や社内資料をAIに渡す人には、情報を付ければ必ず正確になるわけではないと分かる。ただし公開問題を基にした800問は学習済みの可能性があり、単一の生成設定で測った査読前研究である。
重要な回答は、引用元とAI自身の知識を分けて確認したい。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。