ORCA-bench(AI研究)検索・リサーチ確認済み

arXiv論文:本番障害を調べるAI、現実的な設定で正答25.3%——難しい課題は10.0%

本番に近い監視環境と1079件の障害調査課題で5つの先端AIを評価。最良でも中難度25.3%、高難度10.0%だった。

  • 2026-08-02
  • 最終確認日 2026-08-02
自分にどう関係する?

障害対応AIは候補整理には使えても、自動復旧を任せる精度ではありません。ログとコードを渡し、人が最終確認する設計が必要です。

ニュースをやさしく解説

結論から言うと、サーバー障害の原因調査をAIへ丸ごと任せるには、現在の先端モデルでも精度が足りない。2026年7月30日にarXivへ提出された未査読プレプリントは、本番運用に近い障害調査ベンチマーク「ORCA-bench」を公開した。

研究チームは、OpenTelemetryを組み込んだマイクロサービスに6日分、50GBのメトリクス、ログ、トレースを用意し、Prometheus、Jaeger、OpenSearchをGrafana経由で調べられるようにした。ソースコードも渡し、報告の詳しさ、発見までの時間、複数障害の重なり方を変えた1079件の原因調査課題を作った。

専門のSREが正解を確認し、AI採点も人が再評価したところ、一致度は0.90だった。5つの先端エージェントを比べると、最良の正答率は現実的な中難度で25.3%、高難度で10.0%にとどまった。最も弱いモデルは障害報告の40%でありそうにない原因を作り、ソースコードを外すと全指標が悪化した。

運用担当者は、AIを一次調査や候補整理に使い、修正実行の前に人がログ、変更履歴、再現結果を確認したい。ただし公開の模擬環境で課題を1件ずつ調べた結果であり、実システム全体への直接評価ではない。出典はarXiv原論文で、査読前として読む必要がある。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(未査読プレプリント)を開く