SWE-Prime検索・リサーチ確認済み

コード修正AIは成功例を全部学ばなくてよい?「SWE-Prime」、上位10%の履歴で性能向上

成功した作業履歴から質の高い手順だけを選び、少ない教師データで改善するarXiv研究です。

  • 2026-08-28
  • 最終確認日 2026-08-28
自分にどう関係する?

AI開発では学習データの量より、無駄や危険な手順を除いた質が重要だと分かります。

ニュースをやさしく解説

結論から言うと、コード修正AIの学習では、成功した作業履歴を大量に集めるだけでなく、役に立つ手順を選ぶ方が高い性能につながる可能性があります。「SWE-Prime」は、選んだ上位10%の履歴で学習し、成功履歴を全部使う場合を上回ったと報告しました。

研究チームは2026年8月27日、arXivに「SWE-Prime: Fewer Trajectories, Better Performance」を公開しました。会議採択の記載はなく、venueは査読前論文を掲載するarXivです。対象は、ソフトウェア不具合を直すAIエージェントの教師あり学習です。

成功した履歴にも、無駄な操作、危険な変更、結果に貢献しない試行が混ざる問題に注目しました。

SWE-Primeは2段階でデータを選びます。最初に履歴全体を、作業過程の質、最終結果、データの代表性で絞ります。次に連続した操作を意味のまとまりへ分け、解決への貢献、学びやすさ、危険性を評価します。文脈を壊さないため全操作は入力に残しますが、学習の誤差計算には選ばれた部分だけを使います。

SWE-Bench ProとSWE-Bench Verifiedでは、相対性能がそれぞれ最大12.2%と24.2%向上したとしています。

開発者にとっては、AIの成功ログをそのまま教材へ入れず、「なぜ成功したか」「不要な寄り道は何か」「危険な操作はないか」を確認する重要性を示します。社内のコード修正AIを育てる場合も、件数よりレビュー済みの良い手順を優先する設計に応用できます。

注意点として、示された数字は特定のベンチマークでの相対改善で、実際の開発速度が同じ割合で上がる意味ではありません。選別自体にも評価モデルや計算が必要で、別の言語や社内固有コードへの効果は追加検証が要ります。論文はarXivの初版であり、査読や追試によって結論が変わる可能性があります。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXivを開く