AI研究検索・リサーチ確認済み

ICML 2026論文:AIが失敗を短い反省メモにして学習——SRPO、AIME 2024で73.3%

自分の行動履歴から失敗原因を短い反省メモに変えるSRPOを提案。大型教師なしで数学・Web操作・コード修正の成績を改善しました。

  • 2026-08-25
  • 最終確認日 2026-08-25
自分にどう関係する?

作業AIの改善では、結果だけを採点するより、失敗の途中経過を短い教訓へ変える方法が効率化につながります。

ニュースをやさしく解説

結論から言うと、AIが最後の正解・不正解だけを見るのではなく、途中の失敗を自分で短い改善メモに変えると、少ない学習計算でも長い推論を伸ばせる可能性があります。2026年8月24日にarXivへ投稿され、機械学習の国際会議ICML 2026に採択された論文は、Self-Reflective Policy Optimization(SRPO)を提案しました。

SRPOは、AIが完了した行動履歴を振り返り、誤りを簡潔な「reflection patch」にまとめ、そのメモを条件にした教師の評価を各トークンの学習信号へ変えます。最終結果だけのまばらな評価を、途中のどこを直すべきかという細かな信号へ変える仕組みです。別の批評AI、専用の報酬モデル、より大きな教師モデルは不要だとしています。

Qwen3-8Bを土台にした実験では、数学評価AIME 2024で73.3%を記録し、規模を増やした教師あり追加学習の8%の学習計算量で達成しました。WebShopは64.7%、ALFWorldは76.8%、実際のコード修正に近いSWE-Bench-Liteは31.2%でした。

開発者にとっては、AIエージェントを改善する際に成功例だけを増やすのではなく、失敗履歴を短い再利用可能な注意点へ変える設計が参考になります。ただし結果は指定モデルと評価環境での値で、実サービスの速度、費用、安全性を直接保証しません。会議採択論文でも、別モデルや日本語課題での再現確認が必要です。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(ICML 2026採択論文)を開く