研究論文検索・リサーチ確認済み

arXiv論文:AIのまれな危険行動を効率よく探すBLOOM-WILT、32条件中30条件で従来法超え

会話戦略と出力候補の重みを調整し、通常の安全試験では見つけにくい行動を少ない試行で調べます。

  • 2026-08-31
  • 最終確認日 2026-09-01
自分にどう関係する?

AIサービスの安全試験が、まれな危険行動をどこまで見つけられるかを改善する研究です。

ニュースをやさしく解説

結論から言うと、普段はめったに出ないAIの危険な振る舞いを、単純に大量質問するより効率よく見つける監査方法が提案されました。2026年8月31日にarXivへ投稿されたプレプリント「BLOOM-WILT」は、対象モデルを再学習せず、次の単語候補の確率を参照できれば使える自動監査の流れです。入力側では監査役AIが過去の採点結果を見て、複数回の会話で質問戦略を修正します。

出力側では、調べたい行動に関係する候補が先に選ばれやすいよう、対象AI自身の確率分布を適応的に重み付けします。研究チームは4つの対象モデルと8種類の行動、合計32条件で評価し、基準となる監査役を30条件で上回ったと報告しました。例としてQwen3.5-4Bから自傷を勧める行動を引き出す評価では、行動の出現率が平均51%から100%になりました。

この研究は、公開前の安全試験で「見つからなかったから安全」と早合点する危険を減らし、限られた計算量で弱点を探す助けになります。一方、危険出力を意図的に探す技術でもあるため、利用には厳しい権限管理が必要です。またarXivプレプリントで査読済みとは限らず、次単語の確率へアクセスできない一般的なチャット画面にはそのまま使えません。

安全順位が逆転したとの結果も、選んだモデルと8行動の範囲に限られます。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXivを開く