arXiv論文:コードAIの操作履歴から3.73万の再利用環境を復元、評価を11.9点改善
一度きりの操作記録を、何度も質問して実行結果を確かめられるコード学習環境へ変換する研究です。
コードAIの履歴を再現可能な練習環境へ変え、限られた実データを何度も活用する方法が分かります。
ニュースをやさしく解説
結論から言うと、コードを書くAIの過去の操作履歴から、何度も再利用できる実行環境を復元し、学習課題を増やす「Terminal-Universe」がarXivで公開されました。2026年9月3日投稿のプレプリントです。通常、エージェントの操作履歴は一度の成功例や失敗例を記録した固定データにすぎません。
一方、実際に動く環境があれば、条件を変えた課題を何度も出し、実行結果で正誤を確かめられます。提案手法は、履歴に残ったファイル操作を逆にたどってAIが変更する前のファイルを戻し、不足するファイルや依存関係を別の補完AIで埋めます。その上で元の依頼を再構成するだけでなく、複数のコード置き場をまたぐ質問や、利用者の追加要望が続く複数回の会話も合成します。
公開された端末操作履歴へ適用した結果、課題を実行できる環境を3万7300件作成しました。このデータでQwen3.5-27Bを教師あり追加学習すると、1回で解くTerminal-Bench 2.1の成績が11.9ポイント、複数回対話のEvoCode-Bench v2 MT@4が13.8ポイント改善したと報告しています。
コードAIを作る側には、履歴を保存するだけでなく、再現可能な環境として残す価値を示します。ただし、補完AIが作った不足部分が元環境と完全に同じとは限りません。数値は著者らのデータと評価条件によるもので、他モデルや実務コードで同じ改善が出る保証はなく、査読前のプレプリントです。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。