AI研究検索・リサーチ確認済み

arXiv論文:コードAIの設計を176条件で比較——強いモデルでは計画が精度より費用を削減

計画、使える道具、会話履歴の整理を個別に変え、4モデルをSWE-Bench Verifiedなどで比較しました。

  • 2026-09-18
  • 最終確認日 2026-09-18
自分にどう関係する?

コードAIの精度と費用はモデルだけでなく、履歴整理や計画、道具の設計でも変わると分かります。

ニュースをやさしく解説

結論から言うと、コードAIを包む実行システムの最適な設計はモデルの強さと使える文脈量で変わり、同じ設定を全モデルへ当てはめるべきではないという研究結果です。

2026年9月17日にarXivへ投稿されたプレプリント「An Empirical Study of Harness Design for Coding Agents」は、AIの実行ループを固定したまま、計画、操作手段、会話履歴の管理という3部品だけを変えて比べました。

4モデルをSWE-Bench VerifiedとTerminal-Bench 2.1で評価し、履歴管理5方式、文脈量4段階、計画と操作手段の有無を組み合わせた176条件をそろえて検証しています。結果では、使える文脈が小さいほど履歴管理の価値が高まり、主な効果は上限超過による失敗を防ぐことでした。単純な規則で古い情報を省いた後にAIで要約する方式が、全体として効率的でした。

一方、省いた内容を後で呼び戻せる複雑な仕組みは、AIがほとんど使わず正答率も上がりませんでした。計画機能は弱いモデルでは正答率を支え、強いモデルでは精度をほぼ変えず費用を減らしました。用意された専用ツールはbash操作が弱いモデルに有効でしたが、bashに強いモデルはbashだけでも低費用で作業できました。

開発者は、モデル名だけでなく文脈上限と端末操作力に合わせて構成を選ぶ必要があります。ただし対象は2つのベンチマークと4モデルで、実案件すべてに同じ結果が出るとは限りません。査読前のarXivプレプリントです。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXivプレプリントを開く