arXiv論文:AIは自分の作業環境をどこまで改善できるか——5モデル・4課題・111回で評価
プロンプトや道具、記憶、制御手順をAI自身に直させる能力を測るHarnessOpt-Benchを提案。
AIの性能はモデル名だけでなく周囲の設定でも変わります。比較時は同じ予算と見えないテストで確かめる視点が重要です。
ニュースをやさしく解説
結論から言うと、AIモデル本体ではなく、周りのプロンプト・道具・記憶・制御手順をAI自身が改善する力を比べる共通評価「HarnessOpt-Bench」が提案された。2026年8月6日にarXivへ投稿された未査読プレプリントで、ここでいうハーネスは、エージェントを実際に働かせるための設定やプログラム一式を指す。
評価では、最適化役のLLMに、対象エージェントの初期ハーネス、採点結果、固定された評価予算を渡し、コードを何度か直して最後の候補を1つ選ばせる。その候補は、探索中には見せないテスト部分で初期版からの改善量を測る。信頼できる実行環境が予算を管理し、候補の履歴を保存するため、後から何を変えたかも監査できる。
研究チームは最先端LLM 5種類を、共通のコーディング環境と各モデル固有の環境の両方で、4つの下流課題、合計111回の採点実行により比較した。その結果、成績差は使うコーディング環境より最適化役のモデルによって大きく分かれ、各モデル専用の環境が常に有利とは限らなかった。AIエージェントを導入する人には、モデル名だけでなく、道具や指示の組み合わせを同じ予算で比べる考え方が役立つ。
ただし具体的な改善幅は課題と初期設定で大きく変わり、4課題だけで一般的な優劣は決められない。コードとデータは公開予定とされ、現時点では未査読である。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。