arXiv論文:AI本体を変えず「実行の仕組み」を失敗から修正——成功率44.3%から53.6%へ
別の9Bモデルが失敗記録から検証済みパッチを作成。WebShopなど3評価で、Qwen 3.5 9Bの課題成功率を9.3ポイント改善した。
AI本体の再学習が難しくても、失敗ログから文脈・道具・検証・回復の仕組みを直す改善方法が考えられます。
ニュースをやさしく解説
結論から言うと、AIモデル本体の重みを更新しなくても、文脈の組み立て、道具の仲介、行動確認、失敗回復を担う「実行の仕組み」を直すことで、課題成功率を上げられる可能性が示された。2026年8月3日にarXivへ提出された未査読論文は、失敗履歴から実行環境のコードを修正する「Harness-R1」を提案した。
専用の9Bモデルが、対象AIの失敗をまとめて読み、実際に動くパッチへ変換して検証する。対象AIは固定したまま同じ課題を再実行し、成功したかを報酬として、修正を作る側だけをオンライン強化学習する仕組みだ。最初は教師あり学習で基本的な修正方法を覚え、その後にgroup-relative policy optimizationで改善する。
WebShop、ALFWorld、DBBenchの3評価では、未調整のQwen 3.5 9Bの平均成功率が44.3%から53.6%へ9.3ポイント上がった。対象AI本体を直接追加学習した後でも、専用の修正役を使うと59.2%から64.2%へ5.0ポイント改善した。利用者には、AIの答え方だけでなく、渡す情報、道具の呼び方、検証、再試行の設計を実行記録から見直す考え方が役立つ。
ただし検証は3つの環境とQwen 3.5 9Bが中心で、修正コードが新たな権限逸脱や安全上の穴を作らない保証はない。査読前のため、本番反映前に人のコードレビューと隔離環境での試験が必要だ。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。