LAION-BVD(研究)検索・リサーチ確認済み

動画・音声AI向け「LAION-BVD」、1,000万時間規模のオープンデータを発表

Common Crawl由来の13億URLから8,000万本、合計1,000万時間の動画を集めたマルチモーダル学習用データセットです。

  • 2026-08-26
  • 最終確認日 2026-08-26
自分にどう関係する?

動画・音声・画像を横断するAI開発の土台が広がる一方、権利とプライバシー確認の重要性も増します。

ニュースをやさしく解説

結論から言うと、動画・音声・画像をまとめて理解するAIの研究に使える、極めて大規模な公開データセット「LAION-BVD」が発表されました。2026年8月25日にarXivへ提出されたプレプリントによると、研究チームはCommon Crawlから特定動画プラットフォームのURLを13億件集め、そのうち8,000万本、合計1,000万時間の動画を取得しました。

内容の切り替わりを検出して場面ごとの短いクリップを作り、映像と音声の説明文を合成生成しています。これにより、動画と文章、音声と文章、画像と文章を結び付ける事前学習へ同じ基盤を使えます。論文では、データ量やモデル規模を増やすほど標準的な動画・文章、音声・文章の評価で一貫して性能が伸び、競争力のある結果になったと説明しています。

また、場面転換時のフレームを画像データとして取り出すと、一般的なウェブ画像集とは異なる分布になり、画像検索の学習でも強い性能を示したとしています。研究者や開発者には、動画AIを一から試すための共通資源が広がる点が重要です。一方、URL数と実際に取得した動画数は同じではありません。公開範囲、ライセンス、削除要請、人物のプライバシー、合成説明文の誤りは利用前に確認が必要です。

arXivのプレプリントであり、査読済みの最終成果ではない点にも注意してください。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(プレプリント)を開く