研究論文検索・リサーチ確認済み

arXiv論文:音・映像・文章を扱えるAIも矛盾に弱い——人88.64%、最良モデル73.17%

4種類の情報を組み合わせるC3PO評価を提案。失敗の86〜95%で一つの形式に偏る現象を確認した。

  • 2026-08-08
  • 最終確認日 2026-08-08
自分にどう関係する?

複数形式に対応したAIでも文章だけに偏る場合があります。重要な判断では音声・映像・画像の根拠も個別に確認してください。

ニュースをやさしく解説

結論から言うと、動画、音声、画像、文章を同時に扱えるAIでも、情報が食い違うと一つの形式だけを信じ、判断を誤りやすいことが新しい評価で示された。2026年8月5日にarXivのcs.AIへ投稿されたプレプリント「C3PO」は、4種類の情報に分かれた手掛かりをまとめる力と、わざと入れた矛盾を解く力を測る。

評価データは3404件で、論理に基づく25種類の型から自動生成し、難しさを4段階に分けた。人の正答率は88.64%だったのに対し、最良のGemini 3.1 Proでも73.17%。分析では失敗の86〜95%が、一つの情報形式に引っ張られる「モダリティ優位」と関係し、失敗時には注意の87〜95%が文章へ集中していた。

複雑さが同じ型同士でも最大56ポイントの正答率差があり、単に情報の種類が多いかではなく、矛盾を解く中で各情報がどんな役割を持つかが重要だという。音声付き動画の要約や会議記録を使う人には、AIが全部を見聞きできることと、正しく統合できることは別だと分かる。ただし未査読のプレプリントで、自動生成された課題の結果を実社会へそのまま当てはめることはできない。

重要な場面では元の映像・音声・文章を個別に確認したい。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(cs.AI、プレプリント)を開く