arXiv論文:コーディングAIは同じ命令でも実行経路で成績急落——QuoteBench、最大73.2ポイント低下
AIが作ったBash命令を包んで再解釈する処理が失敗を生む問題を、56課題のQuoteBenchで切り分けた。
コーディングAIの失敗がモデル本体ではなく、アプリ側の引用符処理や命令受け渡しで起きる場合があると分かります。
ニュースをやさしく解説
結論から言うと、コーディングAIが正しいBash命令を作れても、アプリがその文字列を包み直して再解釈する途中で壊れ、評価結果が大きく変わることをQuoteBenchが示した。2026年8月13日にarXivで公開された査読前論文で、モデル自身の命令生成能力と、生成後の受け渡し経路で起きる失敗を分けて測る研究である。対象は実際の事故例を基にした14系統、計56件の一発実行課題。
研究者らは、モデルの返答をそのまま実行する経路と、意図的にエスケープされていない解析処理を1段加えた経路を比較し、最後のファイル状態などが正しいかを厳密に確認した。8種類の同一時間枠の構成では、同じ返答を追加解析経路に通すと成功率が55.4〜73.2ポイント低下した。
経路の仕組みをモデルへ知らせると、6構成は30.4〜60.7ポイント回復したが、残る2構成は改善しないか少し悪化した。GPT-5.6-solでは、最終的な成績差だけならマイナス3.6ポイントに見える一方、内部では経路による64.3ポイントの損失と、対応による60.7ポイントの回復が隠れていた。
開発者には、モデル名と総合成功率だけでなく、命令の引用符処理、実行経路、最終状態の検証まで記録する必要性を示す。ただし56課題の人工的な追加解析での結果で、すべての端末やエージェントに同じ低下幅が出るとは限らない。論文は査読前である。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。