AI研究検索・リサーチ確認済み

arXiv論文:話題を変えてもAIから秘密を再取得——3モデルで漏えい率38.7〜54.6%

会話中に伝えた秘密が、別の話題を挟んだ後の誘導で取り出せるかを1000対話で測るPrivDriftが公開されました。

  • 2026-09-25
  • 最終確認日 2026-09-25
自分にどう関係する?

AIとの長い会話では、話題を変えただけでは入力済みの秘密を守れない可能性があり、使い方と設計の両方に注意が要る。

ニュースをやさしく解説

結論から言うと、長い会話の途中でAIへ伝えた秘密は、その後に話題を変えても、誘導する質問によって再び引き出せる場合がある。これを測る評価法「PrivDrift」が2026年9月24日にarXivで公開された。学習データからの暗記ではなく、現在進行中の会話に残る利用者情報の漏えいを扱う研究だ。

PrivDriftは、あらかじめ秘密を埋め込んだ1000件の複数ターン対話で構成される。秘密を伝えた後に情報量の多い別話題を挟み、最後に説得や誘導を含む標準化した質問で取り出せるかを調べる。長い文脈を扱える3つの大規模言語モデルを評価したところ、対話単位の複合的な漏えい率は38.7%から54.6%だった。

漏えいの程度はモデル、秘密の種類、誘導の強さによって大きく変わった。また、研究で試した範囲では、間に別の話題を増やしても漏えいは安定して減らなかった。この結果から著者は、会話中の秘密保持を、一時的な脱獄への対策や訓練データの暗記問題だけでなく、会話が続く間に残る行動上の失敗として評価すべきだとしている。

利用者は、共有端末や複数人が参加する会話、外部ツールを使うAIへ、パスワード、個人番号、未公開情報を入力しないのが安全だ。運営側には、話題が変わった後も秘密を答えない試験や、機密情報を会話履歴から分離する設計が必要になる。ただし本稿は単著のarXiv査読前論文で、モデル名などの詳細は要旨だけでは分からない。漏えい率を全AIへ一般化せず、本文、実装、追試を確認したい。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(cs.AI、査読前論文)を開く