arXiv論文:手元で動くPC操作AI、履歴を増やしても成功率は28.56%で頭打ち——長く考えさせても効果薄
OSWorldの361課題で小型の画面操作AIを検証。履歴4枚が最良で、手順や並列案を増やすほど計算費用に見合わない場合があった。
ローカルの操作AIは、長く考えさせるほど良くなるとは限りません。履歴と手順を絞り、最後の完了確認を人が行う設計に役立ちます。
ニュースをやさしく解説
結論から言うと、手元のパソコンで動かす小型の画面操作AIは、考える時間や履歴を無制限に増やしても、成功率が素直に上がるわけではない。2026年7月30日にarXivへ提出された未査読プレプリントは、Qwen3-VLの8B・30B-A3B、UI-TARS-1.5-7B、OpenCUA-7Bを、実際のUbuntuアプリを操作するOSWorldの361課題で比較した。
履歴画像を0枚から1枚へ増やすと平均成功率は約18%から25%超へ改善し、同じ操作を繰り返す失敗が減った。しかしQwen3-VL-30B-A3Bでは履歴4枚の28.56%が最良で、8枚では27.16%へ下がり、入力トークンは増えた。最大手順を15回から100回へ延ばしても多くのモデルで成功率はほぼ伸びず、未完了なのに成功と判断して止まる失敗へ変わった。
計画役と操作役を分ける2段構成も、書式ミスと追加計算のため単独構成を下回り、4案の並列生成は一部を回復したが費用が大きかった。利用者は、ローカルAIなら履歴4枚程度と短い手順上限から試し、完了画面や保存結果を人が確認したい。ただしA100 80GB上の特定モデルとUbuntu課題による結果で、一般のPCや全製品にそのまま当てはまらない。
出典はarXiv原論文で、査読前として読む必要がある。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。