MMDiff検索・リサーチ確認済み

ICML 2026 Workshop論文:画像AIの内部機能を特定して制御——安全攻撃の成功率を24%低減

マルチモーダル学習で変わった内部特徴を比較し、画像理解・OCR・安全性に関わる機能を個別に弱めたり強めたりするMMDiffを提案した。

  • 2026-08-11
  • 最終確認日 2026-08-11
自分にどう関係する?

画像AIの安全性やOCRを、モデル全体の再学習ではなく内部特徴単位で監査・調整できる可能性があります。

ニュースをやさしく解説

結論から言うと、画像を読めるAIの内部で「空間理解」「文字読み取り」「危険な指示への反応」に関係する特徴を見つけ、狙った機能だけを調整する手法MMDiffが提案された。2026年8月10日にarXivへ投稿され、ICML 2026 Trustworthy AI for Good Workshopに採択された論文だ。

研究チームは、AI内部の働きを多数の特徴へ分けるスパースオートエンコーダーを、文章だけの基礎モデルと画像対応後のモデルで比較した。これにより、画像学習で変化した特徴を探し、特定課題に反応する方向を見つけ、その方向を削除または強める。LLaVA-MORE、PaliGemma 2、InternVL3.5の3系列で、画像内の位置関係、安全性、OCRを評価した。

見つけた特徴を削除すると、狙った空間課題の性能が平均12%、OCRが17%低下し、ほかの画像質問応答には影響を与えずに安全攻撃の成功率を24%下げた。逆に特徴を強めると、一般的な単一層の制御法より空間精度が平均3.6%、OCRが1.8%上がったと著者らは報告する。開発者には、モデル全体を再学習せず、監査で見つけた弱点を部分的に調整する道を示す。

ただし数値は研究用モデルと評価課題での結果で、商用AIや日本語画像でも同じ効果になる保証はない。Workshop採択論文でも、誤った特徴を動かす副作用を実運用データで確認する必要がある。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

ICML 2026 Trustworthy AI for Good Workshop採択論文(arXiv)を開く