ICML 2026論文:AIが失敗を短い反省メモにして学習——SRPO、AIME 2024で73.3%
自分の行動履歴から失敗原因を短い反省メモに変えるSRPOを提案。大型教師なしで数学・Web操作・コード修正の成績を改善しました。
作業AIの改善では、結果だけを採点するより、失敗の途中経過を短い教訓へ変える方法が効率化につながります。
ニュースをやさしく解説
結論から言うと、AIが最後の正解・不正解だけを見るのではなく、途中の失敗を自分で短い改善メモに変えると、少ない学習計算でも長い推論を伸ばせる可能性があります。2026年8月24日にarXivへ投稿され、機械学習の国際会議ICML 2026に採択された論文は、Self-Reflective Policy Optimization(SRPO)を提案しました。
SRPOは、AIが完了した行動履歴を振り返り、誤りを簡潔な「reflection patch」にまとめ、そのメモを条件にした教師の評価を各トークンの学習信号へ変えます。最終結果だけのまばらな評価を、途中のどこを直すべきかという細かな信号へ変える仕組みです。別の批評AI、専用の報酬モデル、より大きな教師モデルは不要だとしています。
Qwen3-8Bを土台にした実験では、数学評価AIME 2024で73.3%を記録し、規模を増やした教師あり追加学習の8%の学習計算量で達成しました。WebShopは64.7%、ALFWorldは76.8%、実際のコード修正に近いSWE-Bench-Liteは31.2%でした。
開発者にとっては、AIエージェントを改善する際に成功例だけを増やすのではなく、失敗履歴を短い再利用可能な注意点へ変える設計が参考になります。ただし結果は指定モデルと評価環境での値で、実サービスの速度、費用、安全性を直接保証しません。会議採択論文でも、別モデルや日本語課題での再現確認が必要です。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。