arXiv論文:同じAI審査を繰り返しても順位が不安定——5万2988回のAPI試験
共有API上のAIを採点者として使う前に、同じ入力で結果が再現するか測る必要があると示した研究です。
AIによる採点やランキングを業務へ入れる前に、同じ入力で結果が再現するか検査する重要性が分かります。
ニュースをやさしく解説
結論から言うと、外部のAI APIを採点者として使う評価は、同じモデル名と同じ入力でも十分に再現しない場合があると報告されました。2026年9月3日にarXivへ公開された事前登録研究で、評価基準を先に固定した2回の試験を行い、合計5万2988回のリクエストを監査しました。
同じ時間帯で順位付けを繰り返したときのスピアマン相関は0.400で、研究側が合格条件とした0.90を大きく下回りました。文字列まで同じ入力を翌日に再送した場合も0.78で、条件の0.99に届きませんでした。著者らは、採点ラベルと意味の対応による偏り、候補間の差より大きい測定ノイズ、同一入力でも順位が変わることを要因として挙げています。
待ち時間を置く、別の指標へ替える、提供会社を変えるといった方法でも、調べた範囲では解決しませんでした。自社運用では静かなサーバー上の自己ホストが改善したものの、負荷がかかると安定性が落ちました。文章の品質判定、学習データ選別、ランキング作成をAIに任せる人は、モデル名を測定器の型番のように信用せず、同一入力の反復、日をまたぐ再試験、人による基準例との比較を先に行うべきです。
ただし結果は共有基盤上の外部測定に限られ、すべてのAPIや用途が不安定だと断定する研究ではありません。数値と範囲は論文要旨に基づきます。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。