ICML 2026論文:AIコーディングエージェントを現実の長い開発課題で測るSWE-Bench Pro
ICML 2026 regularのSWE-Bench Proは、41リポジトリから1,865件の課題を集め、AIエージェントの実務的なソフトウェア開発力を測るベンチマークです。
コーディングAIの宣伝スコアを見る時、簡単なベンチだけでなく実務に近い長い課題での成績を確認する必要があります。
ニュースをやさしく解説
結論から言うと、AIコーディングエージェントの実力を、より現実の仕事に近い形で測る新しい物差しが出ました。ICML 2026 regular論文「SWE-Bench Pro」は、41の現役ソフトウェアリポジトリから1,865件の課題を集めたベンチマークです。
従来のSWE-Benchは有名なオープンソースの短い修正が多く、モデルが学習済みデータを覚えている可能性や、実務の複雑さを十分に反映しない問題がありました。SWE-Bench Proは、公開課題と非公開課題を分け、18件のプロプライエタリなリポジトリやGPL系の制約があるコードも使い、平均107行・4ファイルにまたがる修正を含みます。
論文の説明では、現在の主要AIエージェントは古いSWE-Bench Verifiedでは70%超を解ける一方、SWE-Bench Proでは公開課題で45%未満、非公開課題で20%未満に落ちます。自分に関係するのは、AIが小さなバグ修正に強くても、会社の大きなコードベースではまだ苦戦する点です。出典はOpenReviewのICML 2026ページです。
また、対象は123種類のプログラミング言語にまたがるとされ、単純な競技プログラミングではなく、既存システムの理解、依存関係、複数ファイルの修正を含みます。AIツールを選ぶ側は、ベンチ名だけでなく、公開課題か非公開課題かも見る必要があります。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。