AI研究検索・リサーチ確認済み

arXiv論文:自然文データなしでAIを事前学習——2モデルの自己対戦で数学的な並びと文脈学習が出現

生成役と学習役が自己対戦し、自然データを一度も見ずに未知の自然データへの性能が計算量とともに伸びた。

  • 2026-09-25
  • 最終確認日 2026-09-28
自分にどう関係する?

学習データの不足や権利問題を減らす将来像につながるが、現時点では実用モデルの代替ではなく基礎的な概念実証だ。

ニュースをやさしく解説

結論から言うと、人が集めた文章や画像を使わず、二つのAIが自己対戦して学習データそのものを作る事前学習の実証研究が公開された。2026年9月24日のarXivプレプリント「Self-Play Pretraining with Zero Data」で、特定の学会採択は論文ページに記載されていない。

方法では、生成役のモデルが万能チューリングマシンで実行できるプログラムを提案し、そのプログラムからバイト列を作る。学習役は、その並びの次の要素を予測する。生成役は強化学習によって、学習役には簡単すぎず難しすぎない境界の問題を出すようになり、自動で難易度が上がる教材を作る。両方ともランダムな初期状態から始まり、自然な文章などの実データでは訓練しない。

それでも複数の自然データセットを初見で試すと、計算量を増やすにつれて損失が予測可能な形で下がり、文脈中の例から規則をつかむ学習や、見覚えのある数学的な数列も現れた。将来、著作物や人手のデータだけに頼らず、AIが自分に必要な教材を探す方向につながる。ただし今回は概念実証で、自然データで学ぶ現在の大規模モデルを上回ったという主張ではない。

計算資源が必要で、生成された知識の正しさや社会的な常識を保証する仕組みも別途必要だ。出典は著者によるarXiv論文ページである。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(プレプリント)を開く