Harness-R1(AI研究)検索・リサーチ確認済み

arXiv論文:AI本体を変えず「実行の仕組み」を失敗から修正——成功率44.3%から53.6%へ

別の9Bモデルが失敗記録から検証済みパッチを作成。WebShopなど3評価で、Qwen 3.5 9Bの課題成功率を9.3ポイント改善した。

  • 2026-08-05
  • 最終確認日 2026-08-05
自分にどう関係する?

AI本体の再学習が難しくても、失敗ログから文脈・道具・検証・回復の仕組みを直す改善方法が考えられます。

ニュースをやさしく解説

結論から言うと、AIモデル本体の重みを更新しなくても、文脈の組み立て、道具の仲介、行動確認、失敗回復を担う「実行の仕組み」を直すことで、課題成功率を上げられる可能性が示された。2026年8月3日にarXivへ提出された未査読論文は、失敗履歴から実行環境のコードを修正する「Harness-R1」を提案した。

専用の9Bモデルが、対象AIの失敗をまとめて読み、実際に動くパッチへ変換して検証する。対象AIは固定したまま同じ課題を再実行し、成功したかを報酬として、修正を作る側だけをオンライン強化学習する仕組みだ。最初は教師あり学習で基本的な修正方法を覚え、その後にgroup-relative policy optimizationで改善する。

WebShop、ALFWorld、DBBenchの3評価では、未調整のQwen 3.5 9Bの平均成功率が44.3%から53.6%へ9.3ポイント上がった。対象AI本体を直接追加学習した後でも、専用の修正役を使うと59.2%から64.2%へ5.0ポイント改善した。利用者には、AIの答え方だけでなく、渡す情報、道具の呼び方、検証、再試行の設計を実行記録から見直す考え方が役立つ。

ただし検証は3つの環境とQwen 3.5 9Bが中心で、修正コードが新たな権限逸脱や安全上の穴を作らない保証はない。査読前のため、本番反映前に人のコードレビューと隔離環境での試験が必要だ。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(未査読プレプリント)を開く