AI研究検索・リサーチ確認済み

arXiv論文:同じAI審査を繰り返しても順位が不安定——5万2988回のAPI試験

共有API上のAIを採点者として使う前に、同じ入力で結果が再現するか測る必要があると示した研究です。

  • 2026-09-04
  • 最終確認日 2026-09-04
自分にどう関係する?

AIによる採点やランキングを業務へ入れる前に、同じ入力で結果が再現するか検査する重要性が分かります。

ニュースをやさしく解説

結論から言うと、外部のAI APIを採点者として使う評価は、同じモデル名と同じ入力でも十分に再現しない場合があると報告されました。2026年9月3日にarXivへ公開された事前登録研究で、評価基準を先に固定した2回の試験を行い、合計5万2988回のリクエストを監査しました。

同じ時間帯で順位付けを繰り返したときのスピアマン相関は0.400で、研究側が合格条件とした0.90を大きく下回りました。文字列まで同じ入力を翌日に再送した場合も0.78で、条件の0.99に届きませんでした。著者らは、採点ラベルと意味の対応による偏り、候補間の差より大きい測定ノイズ、同一入力でも順位が変わることを要因として挙げています。

待ち時間を置く、別の指標へ替える、提供会社を変えるといった方法でも、調べた範囲では解決しませんでした。自社運用では静かなサーバー上の自己ホストが改善したものの、負荷がかかると安定性が落ちました。文章の品質判定、学習データ選別、ランキング作成をAIに任せる人は、モデル名を測定器の型番のように信用せず、同一入力の反復、日をまたぐ再試験、人による基準例との比較を先に行うべきです。

ただし結果は共有基盤上の外部測定に限られ、すべてのAPIや用途が不安定だと断定する研究ではありません。数値と範囲は論文要旨に基づきます。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXivを開く