DDO研究チーム検索・リサーチ確認済み

EMNLP 2026論文:AIエージェントが成功ルートを一つに偏らず学ぶ「DDO」

同じ状況から分かれる複数の成功手順を集め、成功率と戦略の幅を同時に伸ばす学習法です。

  • 2026-09-11
  • 最終確認日 2026-09-11
自分にどう関係する?

操作AIが一つの手順を暗記せず、失敗や画面変更に応じて別の成功ルートを選ぶ研究が分かります。

ニュースをやさしく解説

結論から言うと、EMNLP 2026本会議採択論文「Direct Diversity Optimization」は、AIエージェントが一つの成功パターンだけに偏らず、複数の有効な手順を使えるようにする学習法DDOを提案しました。論文は2026年9月9日にarXivへ投稿されています。

買い物サイトの操作やゲームのように判断を何度も続ける課題では、最終的に成功したかどうかだけを使ってAIを追加学習する方法があります。ただし同じ場面から複数の正しい進み方があっても、結果のラベルだけでは各ルートの違いを十分に教えられず、AIが一つの戦略へ寄りやすい問題がありました。

DDOは、共通の判断地点から分かれる成功ルートをまとめるDivergence-Tree Collectionと、基準モデルに対する各選択肢の望ましさを学ぶReference-Relative Target-Oddsを組み合わせます。

著者らはBabyAI、BabaIsAI、WebShopで評価し、比較した追加学習法の中で、課題の成功率と成功戦略のカバー範囲がともに最も高かったと報告しました。途中の行動を別のものに置き換えた後、成功ルートへ戻れる割合も最高でした。利用者には、サイト操作AIが画面変更や途中の失敗に合わせて別ルートへ切り替える力の向上につながります。

ただし結果は3つの研究環境での比較で、実際の銀行や通販サイトで安全に動く保証ではありません。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(EMNLP 2026本会議採択論文)を開く