ICML 2026 Workshop論文:画像AIの内部機能を特定して制御——安全攻撃の成功率を24%低減
マルチモーダル学習で変わった内部特徴を比較し、画像理解・OCR・安全性に関わる機能を個別に弱めたり強めたりするMMDiffを提案した。
画像AIの安全性やOCRを、モデル全体の再学習ではなく内部特徴単位で監査・調整できる可能性があります。
ニュースをやさしく解説
結論から言うと、画像を読めるAIの内部で「空間理解」「文字読み取り」「危険な指示への反応」に関係する特徴を見つけ、狙った機能だけを調整する手法MMDiffが提案された。2026年8月10日にarXivへ投稿され、ICML 2026 Trustworthy AI for Good Workshopに採択された論文だ。
研究チームは、AI内部の働きを多数の特徴へ分けるスパースオートエンコーダーを、文章だけの基礎モデルと画像対応後のモデルで比較した。これにより、画像学習で変化した特徴を探し、特定課題に反応する方向を見つけ、その方向を削除または強める。LLaVA-MORE、PaliGemma 2、InternVL3.5の3系列で、画像内の位置関係、安全性、OCRを評価した。
見つけた特徴を削除すると、狙った空間課題の性能が平均12%、OCRが17%低下し、ほかの画像質問応答には影響を与えずに安全攻撃の成功率を24%下げた。逆に特徴を強めると、一般的な単一層の制御法より空間精度が平均3.6%、OCRが1.8%上がったと著者らは報告する。開発者には、モデル全体を再学習せず、監査で見つけた弱点を部分的に調整する道を示す。
ただし数値は研究用モデルと評価課題での結果で、商用AIや日本語画像でも同じ効果になる保証はない。Workshop採択論文でも、誤った特徴を動かす副作用を実運用データで確認する必要がある。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。