Layer Dropout研究チーム検索・リサーチ確認済み

ICML 2026論文:LLMの層を一部休ませ、学習計算を最大25%削減・推論を最大1.5倍高速化

2400超の実験で、層単位のドロップアウトを正しく設定すれば精度をほぼ保ちながら効率化できました。

  • 2026-09-08
  • 最終確認日 2026-09-08
自分にどう関係する?

AIの学習費用と応答待ち時間を減らす設計として、モデルの層を選んで使う効果が数値で分かります。

ニュースをやさしく解説

結論から言うと、ICML 2026掲載論文は、大規模言語モデルの学習中に一部の層を確率的に休ませる「Layer Dropout」を適切に使うと、性能をほぼ保ちながら学習と推論を効率化できると報告しました。拡張版は2026年9月4日にarXivへ投稿されています。

研究チームは、Layer Dropoutが近年のLLM学習であまり使われなくなった理由を調べ、層への配分、学習中の時間スケジュール、最適化設定を組み合わせて検証しました。具体的には、2億7100万から82億パラメータのモデル、最大1600億トークンのデータを含む2400件超の学習実験をCerebras CS-3上で実施しました。

同じ学習ステップ数なら検証損失を同等以下に保ちつつ、学習時の計算量を最大25%削減できたとしています。学習後も、途中の層で答えを出す、層を飛ばす、モデル自身で次の語を先読みする方法に利用でき、精度低下をほぼ起こさず推論を最大1.5倍高速化しました。AIを開発・運用する側には、モデル全体を毎回同じように計算しない設計が電力や待ち時間の削減につながる可能性があります。

ただし最大値がすべてのモデルや用途で出るわけではなく、実験規模の上限は8.2Bです。一般利用者が既存のチャットAI設定だけで有効にできる機能でもありません。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(ICML 2026)を開く