長期タスクのAIエージェント、経験と作業記憶を再帰的に改善する「Recuris」
長い履歴に埋もれず、失敗の証拠を使ってスキル記憶を更新する仕組みが、複数ベンチマークで成功率を改善しました。
長時間動くAIを安定させるには、モデル変更だけでなく記憶と技能の更新方法が重要だと具体的に示しています。
ニュースをやさしく解説
結論から言うと、長い作業を続けるAIエージェントでは、モデル本体を学習し直さなくても「今の進捗」と「過去の経験」を分けて管理し、失敗した部分だけを直すことで成功率を高められる可能性があります。2026年8月25日にarXivへ提出されたプレプリントで、研究チームはRecurisという仕組みを発表しました。
Recurisは、現在の作業状態を追う作業記憶と、使える技能を蓄える経験記憶を組み合わせ、長い会話履歴を毎回すべて頼りにせず、必要な技能を選びます。実行結果は、どの記憶部品で失敗したかを示す証拠として整理され、固定されたメタエージェントが検証を通った変更だけを技能記憶へ反映します。4種類の長期タスク評価と10モデルで試し、完了した37組のうち35組で成功率が向上しました。
tau-benchではGPT-5.6 Solが17.8ポイント、Claude Opus 5が15.6ポイント改善し、後者は87.9%に達したと報告しています。最長タスクでは差が32.2ポイントに広がり、よくある失敗は最大80%減りました。仕事の自動化を設計する人には、巨大な履歴をそのまま渡すより、進捗メモ、技能集、変更前のテストを分けるという実用的なヒントになります。
ただし、これは査読済み会議論文ではなくarXiv上のプレプリントで、著者らの評価条件に基づく結果です。実環境で同じ改善が出るとは限らず、公開コードを含む追試が必要です。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。