SafeKeep(AI研究)検索・リサーチ確認済み

arXiv論文:AIに道具の仕様を渡すだけで拒否が弱まる——SafeKeepは攻撃成功率を25.6%から2.5%へ

道具を使うAIの安全低下を仕様書の形式から分析。安全判断だけ平文仕様で行う防御を4モデルで検証した。

  • 2026-08-03
  • 最終確認日 2026-08-03
自分にどう関係する?

AIにメール送信や購入などの権限を渡すと、モデル単体とは安全性が変わります。接続後の状態で危険な依頼と注入攻撃を再試験する必要があります。

ニュースをやさしく解説

結論から言うと、AIエージェントへ検索や送金などの道具をつなぐ際、道具の説明を機械向けの表形式で渡すだけでも、危険な依頼を断る内部信号が弱まる可能性がある。2026年7月31日にarXivへ提出された未査読プレプリントは、道具の仕様形式を安全性低下の主因の一つとして分析し、防御手法「SafeKeep」を提案した。

一般的なエージェントは、道具名、入力項目、型などをschema形式でLLMへ見せる。研究チームがモデル内部の表現を調べると、この形式が拒否に関係する信号を弱め、危険な道具実行につながっていた。SafeKeepは、安全判断の段階だけ仕様を読みやすい平文へ変換し、実行時は元のschemaを残すことで、判断と操作を分ける。

2つの代表的な評価基盤と、内部を調べられるもの・調べられないものを含む4モデルで試すと、有害な依頼の平均拒否率は23.8%から70.6%へ上がった。画面や観測情報へ攻撃指示を混ぜるプロンプト注入の平均成功率は25.6%から2.5%へ下がり、通常の課題処理能力も保ったという。

利用者や開発者は、外部ツールを追加した後に、チャット単体の安全試験を流用せず、実際の仕様と権限を付けた状態で再検査すべきだ。ただし評価は4モデルと2基盤に限られ、すべての道具や未知の攻撃への効果は未確認である。出典はarXiv原論文で、査読前の結果として扱いたい。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(未査読プレプリント)を開く