Recuris(研究)検索・リサーチ確認済み

長期タスクのAIエージェント、経験と作業記憶を再帰的に改善する「Recuris」

長い履歴に埋もれず、失敗の証拠を使ってスキル記憶を更新する仕組みが、複数ベンチマークで成功率を改善しました。

  • 2026-08-26
  • 最終確認日 2026-08-26
自分にどう関係する?

長時間動くAIを安定させるには、モデル変更だけでなく記憶と技能の更新方法が重要だと具体的に示しています。

ニュースをやさしく解説

結論から言うと、長い作業を続けるAIエージェントでは、モデル本体を学習し直さなくても「今の進捗」と「過去の経験」を分けて管理し、失敗した部分だけを直すことで成功率を高められる可能性があります。2026年8月25日にarXivへ提出されたプレプリントで、研究チームはRecurisという仕組みを発表しました。

Recurisは、現在の作業状態を追う作業記憶と、使える技能を蓄える経験記憶を組み合わせ、長い会話履歴を毎回すべて頼りにせず、必要な技能を選びます。実行結果は、どの記憶部品で失敗したかを示す証拠として整理され、固定されたメタエージェントが検証を通った変更だけを技能記憶へ反映します。4種類の長期タスク評価と10モデルで試し、完了した37組のうち35組で成功率が向上しました。

tau-benchではGPT-5.6 Solが17.8ポイント、Claude Opus 5が15.6ポイント改善し、後者は87.9%に達したと報告しています。最長タスクでは差が32.2ポイントに広がり、よくある失敗は最大80%減りました。仕事の自動化を設計する人には、巨大な履歴をそのまま渡すより、進捗メモ、技能集、変更前のテストを分けるという実用的なヒントになります。

ただし、これは査読済み会議論文ではなくarXiv上のプレプリントで、著者らの評価条件に基づく結果です。実環境で同じ改善が出るとは限らず、公開コードを含む追試が必要です。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(プレプリント)を開く