arXiv論文:コードAIは実行中の動きを読めるか——12リポジトリ480問で最高37%
SWE-Fluxは実際のテスト実行から正解を収集し、LLMが大規模コードの実行時挙動を推測できるか測りました。
コードAIの説明力には実行確認で埋めるべき弱点があり、テストとログを省かない判断材料になる。
ニュースをやさしく解説
結論から言うと、2026年9月23日にarXivへ公開されたプレプリント「SWE-Flux」は、コードAIがリポジトリ全体の実行時挙動を答える新しい評価で、調べた5モデルの最高正答率が37%にとどまったと報告した。コードを書けることと、実際に走らせた時の状態を正確に説明できることは別だと示す結果である。
SWE-Fluxは、実在する12件のPythonリポジトリから480問を作った。対象は制御の流れ、繰り返し、プログラムの状態、データの受け渡し、例外、常に成り立つ条件で、1件のテストだけを見る問題と複数テストをまとめる問題を含む。正解は人の印象や別のLLMによる採点ではなく、計測用の処理を加えたテストを実行して自動収集した。
モデルは関数内の制御、例外、単純な繰り返し、局所的な条件では比較的良かった。一方、関数をまたぐデータの流れ、正確な状態変化、テスト群全体の集計で苦戦した。研究チームは入力を少し変えた新しい問題を作る仕組みも試し、選んだ事例の約90%で有効な変種を収集できた。変種は元の問題よりモデルにとって大幅に難しかったという。
開発者には、AIのコード説明をそのまま信じず、テスト、ログ、デバッガーで実行結果を確認する必要性が分かる。特に複数関数や複数テストにまたがる不具合では、人が状態の変化を追うべきだ。ただし数値は著者が選んだ5モデルとPythonリポジトリに限られ、査読前である。モデル名や設定、問題作成法を本文で確認してから一般化したい。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。