AI研究検索・リサーチ確認済み

arXiv論文:コーディングAIは同じ命令でも実行経路で成績急落——QuoteBench、最大73.2ポイント低下

AIが作ったBash命令を包んで再解釈する処理が失敗を生む問題を、56課題のQuoteBenchで切り分けた。

  • 2026-08-15
  • 最終確認日 2026-08-15
自分にどう関係する?

コーディングAIの失敗がモデル本体ではなく、アプリ側の引用符処理や命令受け渡しで起きる場合があると分かります。

ニュースをやさしく解説

結論から言うと、コーディングAIが正しいBash命令を作れても、アプリがその文字列を包み直して再解釈する途中で壊れ、評価結果が大きく変わることをQuoteBenchが示した。2026年8月13日にarXivで公開された査読前論文で、モデル自身の命令生成能力と、生成後の受け渡し経路で起きる失敗を分けて測る研究である。対象は実際の事故例を基にした14系統、計56件の一発実行課題。

研究者らは、モデルの返答をそのまま実行する経路と、意図的にエスケープされていない解析処理を1段加えた経路を比較し、最後のファイル状態などが正しいかを厳密に確認した。8種類の同一時間枠の構成では、同じ返答を追加解析経路に通すと成功率が55.4〜73.2ポイント低下した。

経路の仕組みをモデルへ知らせると、6構成は30.4〜60.7ポイント回復したが、残る2構成は改善しないか少し悪化した。GPT-5.6-solでは、最終的な成績差だけならマイナス3.6ポイントに見える一方、内部では経路による64.3ポイントの損失と、対応による60.7ポイントの回復が隠れていた。

開発者には、モデル名と総合成功率だけでなく、命令の引用符処理、実行経路、最終状態の検証まで記録する必要性を示す。ただし56課題の人工的な追加解析での結果で、すべての端末やエージェントに同じ低下幅が出るとは限らない。論文は査読前である。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(査読前論文)を開く