arXiv論文:話題を変えてもAIから秘密を再取得——3モデルで漏えい率38.7〜54.6%
会話中に伝えた秘密が、別の話題を挟んだ後の誘導で取り出せるかを1000対話で測るPrivDriftが公開されました。
AIとの長い会話では、話題を変えただけでは入力済みの秘密を守れない可能性があり、使い方と設計の両方に注意が要る。
ニュースをやさしく解説
結論から言うと、長い会話の途中でAIへ伝えた秘密は、その後に話題を変えても、誘導する質問によって再び引き出せる場合がある。これを測る評価法「PrivDrift」が2026年9月24日にarXivで公開された。学習データからの暗記ではなく、現在進行中の会話に残る利用者情報の漏えいを扱う研究だ。
PrivDriftは、あらかじめ秘密を埋め込んだ1000件の複数ターン対話で構成される。秘密を伝えた後に情報量の多い別話題を挟み、最後に説得や誘導を含む標準化した質問で取り出せるかを調べる。長い文脈を扱える3つの大規模言語モデルを評価したところ、対話単位の複合的な漏えい率は38.7%から54.6%だった。
漏えいの程度はモデル、秘密の種類、誘導の強さによって大きく変わった。また、研究で試した範囲では、間に別の話題を増やしても漏えいは安定して減らなかった。この結果から著者は、会話中の秘密保持を、一時的な脱獄への対策や訓練データの暗記問題だけでなく、会話が続く間に残る行動上の失敗として評価すべきだとしている。
利用者は、共有端末や複数人が参加する会話、外部ツールを使うAIへ、パスワード、個人番号、未公開情報を入力しないのが安全だ。運営側には、話題が変わった後も秘密を答えない試験や、機密情報を会話履歴から分離する設計が必要になる。ただし本稿は単著のarXiv査読前論文で、モデル名などの詳細は要旨だけでは分からない。漏えい率を全AIへ一般化せず、本文、実装、追試を確認したい。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。