研究論文(arXiv)検索・リサーチ確認済み

論文:OpenForgeRL、Claude CodeやCodex型の「実ハーネス」でAIエージェントを訓練する枠組みを提案

arXivに7月23日投稿。OpenForgeRLは、実際の推論ハーネスを動かしながらデータを記録し、RL基盤でエージェントを訓練する方法を示した。

  • 2026-07-26
  • 最終確認日 2026-07-26
自分にどう関係する?

AIエージェントの評価では、モデル単体ではなく実行ハーネス込みで見る必要がある。

ニュースをやさしく解説

結論から言うと、AIエージェントを本番に近い形で鍛えるには、モデルだけでなく「Claude CodeやCodexのような作業ハーネス」ごと訓練できる仕組みが必要だ、という論文が出た。

arXiv(cs.AI、2026年7月23日投稿)の「OpenForgeRL: Train Harness-native Agents in Any Environment」は、状態を持つ複雑なエージェント実行環境を、既存のSFT/RL基盤で扱いにくい問題として整理している。

提案するOpenForgeRLは、ハーネスがモデルへ投げる呼び出しを軽量proxyで受け、学習データとして記録し、Kubernetesで各ロールアウトを別コンテナに分けて動かす。これにより、ツール利用、GUIブラウザ、computer-useなどの実環境に近い作業を、訓練と評価の対象にできる。

実験ではOpenForgeClawやOpenForgeGUIが複数ベンチマークで同規模のオープンベースラインを上回り、GUIではより大きなモデルに並ぶ例も示した。一方で、ハーネスによって学習しやすさが違い、エラー回復など弱い能力も残る。私たちに関係するのは、AIエージェントの性能差がモデル名だけで決まらず、周りの実行環境や訓練方法にも左右される点だ。出典はarXiv一次ページ。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv (cs.AI)を開く