STAIR(AI研究)検索・リサーチ確認済み

arXiv論文:コード修正AIが過去の直し方を「作戦」として再利用——STAIRでSWE-bench正解率81.2%

過去の修正履歴を診断手順から大方針まで階層化し、新しい不具合へ適応。別構造のAIでもPass@1が75.8%から81.0%へ上がった。

  • 2026-07-31
  • 最終確認日 2026-08-04
自分にどう関係する?

修正AIを毎回ゼロから働かせず、過去の調査と修正を組織の再利用可能な知識に変える方法です。

ニュースをやさしく解説

結論から言うと、コード修正AIに過去の成功手順を整理して渡すと、モデル本体を変えなくても新しい不具合を直せる割合が上がると報告された。2026年7月31日にarXivへ提出された未査読プレプリントは、修正履歴を再利用可能な計画へ変える「STAIR」を提案した。従来の修正AIは、以前に似た原因を調査していても、その操作や判断を次の課題へ持ち越さないことが多い。

STAIRは過去の作業軌跡を、細かな診断操作、中くらいの手順、全体の修正戦略という階層ツリーに変換する。新しい問題が来ると、複数の階層から関係する部分を選び、そのリポジトリ向けの実行計画へ書き直してプロンプトに加える。

実際のGitHub不具合を使うSWE-bench Verifiedで、LingxiとMiniMax M2.5の組み合わせはPass@1が81.2%、GPT-5では79.2%だった。さらに計画を別構造のmini-SWE-agent v2へ渡すだけで、75.8%から81.0%へ改善した。利用者には、社内の修正記録を単なるログでなく、再利用できる調査手順として蓄える価値がある。

ただし比較条件ごとの元の点数や費用、未知の社内コードでの効果は追加確認が必要で、査読前の著者報告として読むべきだ。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(未査読プレプリント)を開く