arXiv論文:画面操作AIが失敗を振り返り自己改善——6評価で平均精度7.4%向上
未知の画面で試行、評価、反省、学習を繰り返す方法により、クリック位置を見つけるAIの精度が平均7.4%上がりました。
画面変更に弱い操作AIが、人の正解ラベルなしで現場に適応できれば、自動化の保守負担を減らせます。
ニュースをやさしく解説
結論から言うと、画面を操作するAIは、公開後に初めて見るアプリでも、失敗を振り返って自分を更新することでクリック位置の特定精度を上げられる可能性があります。2026年8月11日にarXivへ投稿された論文は、画面画像と指示から押す場所を決めるGUI Visual Grounding向けに、Test-Time Self-Evolvingという枠組みを提案しました。
従来の多くのモデルは提供開始後に重みを固定し、未知の画面へ適応しにくい問題がありました。新手法は「探索、評価、反省、内部化」の輪を作ります。AIが座標を予測し、別のマルチモーダルAIであるReflectorが結果を評価して反省文を作り、その内容を細かな学習信号へ変えてモデル自身に教え直します。
さらに、失敗した予測の誤った途中経過が学習を壊さないよう、Contrastive Calibrationという補正も加えました。6つのベンチマークで、元のモデルより平均精度が7.4%向上したと報告しています。利用者にとっては、Webサイトや業務アプリの見た目が変わるたびに人が正解座標を大量に付け直す負担を減らせる可能性があります。
一方、評価役もAIなので、誤った自己評価を取り込む危険があります。論文はコードを今後公開するとしており、現時点で第三者が同じ結果を再現できる状態かは確認が必要です。掲載先は査読前のarXivで、改善値は著者らの実験結果です。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。