ReToken(AI研究)検索・リサーチ確認済み

arXiv論文:長い動画を読むAI、必要な映像だけ選ぶ「1トークン」で精度向上——単一H100で学習・推論

ReTokenは質問に関係する映像トークンを絞り込む軽量手法。画像検索で最大13.4点、長時間動画で8.0点の改善を報告した。

  • 2026-08-01
  • 最終確認日 2026-08-01
自分にどう関係する?

長い動画AIの処理費用と精度を両立する考え方です。製品化前の研究なので、自社動画で再現性を確かめる必要があります。

ニュースをやさしく解説

結論から言うと、長い動画や大量の画像を読むAIは、すべてを同時に覚えさせなくても、質問に必要な部分を選ぶ「1つの学習用トークン」で精度を上げられる可能性がある。2026年7月30日にarXivへ提出された未査読プレプリントは、ReTokenという手法を提案した。

画像と言葉を扱うAIは、関係のない画像が増えるほど答えを探しにくくなり、全画像の情報を一度に処理するとGPUメモリも大量に使う。ReTokenは、あらかじめ保存した映像のKVキャッシュから、質問に関係する少数の視覚トークンだけを選ぶ目印として、1個の学習可能な埋め込みを追加する。

小規模な画像QAデータだけで学習した実験では、Visual HaystacksでQwen3VL-8Bが13.4ポイント、InternVL3.5が12.4ポイント改善し、長時間動画のLVBenchでは追加学習なしでQwen3VL-8Bが8.0ポイント上がった。学習と長時間動画の推論は、どちらもH100 GPU 1枚に収まったという。

動画検索や監視映像、授業録画の質問応答を作る人には、処理費用を抑えながら必要場面を拾う設計の参考になる。ただし結果は特定モデルとベンチマークでの研究値で、一般利用できる製品ではない。実際の動画では字幕、画質、質問の種類でも性能が変わるため、自社データでの確認が必要だ。出典はarXiv原論文で、査読前として読む必要がある。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(未査読プレプリント)を開く