研究論文検索・リサーチ確認済み
arXiv論文:AIは古い会話に引っ張られ道具選択を32.1%変更——正しい最新状態を学ぶ方法を提案
見た目は自然でも現在は誤りとなった履歴が道具操作を乱す問題を評価。小型Qwenの正確さを87.0%へ改善した。
自分にどう関係する?
長い会話でAIに作業を頼む時は、最新の対象や使う道具を明示し直す方が安全だと分かります。
ニュースをやさしく解説
結論から言うと、AIエージェントは、昔は正しかったが現在は使えない会話や道具の記録に強く引っ張られることがある。2026年8月6日にarXivのcs.AIへ投稿された未査読プレプリント「When History Lies」は、最新の依頼や道具が同じでも、過去の履歴だけを汚す比較評価を行った。
Qwen3-1.7Bでは、元の履歴なら正しかった判断の32.1%が変わり、古い対象名や操作形式を再利用する失敗が多かった。研究チームは、Original、Polluted、Oracle Stateの3種類を対にした評価データと、正しい現在状態を見られる教師AIから、汚れた履歴しか見られない生徒AIへ方針を移す学習法を提案した。
その結果、1.7BモデルのBalanced Tool-Use Accuracyは87.0%となり、Gold-SFTの66.3%やOracle系列蒸留の82.3%を上回った。8B教師を使うと同じ小型モデルは91.9%、8B生徒は93.0%に達した。利用者は、長く続くチャットや自動化で、古い指示を残し過ぎず、現在の対象・道具・目的を明示し直す重要性を理解できる。
ただし結果は特定のモデルと作成条件を含む研究評価で、実製品すべてに同じ割合で起きるとは限らない。未査読のため追加検証も必要だ。
PR
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。
広告