arXiv:Qwenの画面操作AI、実機で成功率92.2%——1万環境で100手超を学習
画面操作とコマンド実行を1つのAIで扱い、スマホ・PC・Web・深掘り検索を横断。実機評価の採点誤差には注意が必要。
画面操作AIが実機と長い手順へ近づいていますが、重要操作では採点結果や成功表示だけでなく、実際の最終状態を確認する必要があります。
ニュースをやさしく解説
結論から言うと、スマホやパソコンの画面を操作するAIは、実機と大規模な練習環境を組み合わせることで、長い手順をかなり高い成功率でこなせる段階へ進んでいる。2026年7月30日にarXivへ提出された未査読の技術報告は、スマホ、PC、Web、深掘り検索を1つの仕組みで扱う「Qwen-UI-Agent」を発表した。
画面のクリックや文字入力と、コマンドライン操作を同じ行動形式で組み合わせ、複数の操作を1回の応答でまとめて出せる。学習では最大1万の隔離環境を並列稼働し、100手を超える操作履歴にもオンライン強化学習を適用した。
27Bモデルの成功率はMobileWorldで82.1%、100種類超のアプリを含む実機MobileWorld-Realで92.2%、AndroidDailyで97.5%だった。PCではOSWorld-Verifiedが79.5%、より難しいOSWorld-v2の部分進捗は40.0%、WebArenaは73.6%と報告している。
利用者には、将来の予約、調査、複数アプリをまたぐ作業をAIへ任せる基盤として関係する一方、送信、購入、削除は最終状態を人が確認する必要がある。実機評価は人手ではなくAutoJudgeで採点し、専門家が確認した666例との完全一致は92.8%だったため、残る誤差が数値へ影響し得る。35B-A3Bの一部学習も未完了であり、出典はarXivの査読前技術報告として扱いたい。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。