研究論文検索・リサーチ確認済み

arXiv論文:コードAIは実行中の動きを読めるか——12リポジトリ480問で最高37%

SWE-Fluxは実際のテスト実行から正解を収集し、LLMが大規模コードの実行時挙動を推測できるか測りました。

  • 2026-09-24
  • 最終確認日 2026-09-24
自分にどう関係する?

コードAIの説明力には実行確認で埋めるべき弱点があり、テストとログを省かない判断材料になる。

ニュースをやさしく解説

結論から言うと、2026年9月23日にarXivへ公開されたプレプリント「SWE-Flux」は、コードAIがリポジトリ全体の実行時挙動を答える新しい評価で、調べた5モデルの最高正答率が37%にとどまったと報告した。コードを書けることと、実際に走らせた時の状態を正確に説明できることは別だと示す結果である。

SWE-Fluxは、実在する12件のPythonリポジトリから480問を作った。対象は制御の流れ、繰り返し、プログラムの状態、データの受け渡し、例外、常に成り立つ条件で、1件のテストだけを見る問題と複数テストをまとめる問題を含む。正解は人の印象や別のLLMによる採点ではなく、計測用の処理を加えたテストを実行して自動収集した。

モデルは関数内の制御、例外、単純な繰り返し、局所的な条件では比較的良かった。一方、関数をまたぐデータの流れ、正確な状態変化、テスト群全体の集計で苦戦した。研究チームは入力を少し変えた新しい問題を作る仕組みも試し、選んだ事例の約90%で有効な変種を収集できた。変種は元の問題よりモデルにとって大幅に難しかったという。

開発者には、AIのコード説明をそのまま信じず、テスト、ログ、デバッガーで実行結果を確認する必要性が分かる。特に複数関数や複数テストにまたがる不具合では、人が状態の変化を追うべきだ。ただし数値は著者が選んだ5モデルとPythonリポジトリに限られ、査読前である。モデル名や設定、問題作成法を本文で確認してから一般化したい。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(SWE-Fluxプレプリント)を開く