OctoLong(AI研究)検索・リサーチ確認済み

arXiv論文:複数リポジトリをまたぐコード教材「OctoLong」——長文教材の12%置換で理解力が向上

AST解析・言語サーバー・パッケージ管理で依存関係を追い、数百万トークン級のコード教材を構築。18モデルと比較した。

  • 2026-08-07
  • 最終確認日 2026-08-07
自分にどう関係する?

コードAIへ長文を与えるだけでなく、実際の依存関係をたどる教材設計が重要だと分かります。

ニュースをやさしく解説

結論から言うと、長いコードを読めるAIを育てるには、1つのファイルやリポジトリを長く並べるだけでなく、実際の依存関係をたどった教材が有効だとする研究が出た。2026年8月5日にarXivへ提出された未査読論文は、複数のリポジトリをまたぐコード文脈を作る仕組み「OctoLong」を提案した。

抽象構文木を読むAST解析器、定義や参照を探す言語サーバー、外部ライブラリを管理するパッケージ管理機能を組み合わせ、呼び出し先を再帰的に追跡。数百万トークン規模でも、離れた場所のつながりを含む教材を作る。

研究チームは6億〜140億パラメータのOctoLong-Instruct群を作り、約500億トークンの中間学習用データのうち約62億トークンをOctoLongにし、その後約100億トークンで指示学習した。

最先端の公開長文モデル18種類との比較と条件を変えた実験では、従来の長文教材の12%をOctoLongへ置き換えるだけで、遠距離の情報検索、長期状態追跡、リポジトリ理解、エージェント課題が改善し、短いコードでのAPI利用にも効果があったという。開発者には、大規模コードベース用AIの学習設計を見直す手掛かりになる。

ただし査読前で、要旨には各評価の点数や計算費用がなく、実務の非公開コードで同じ伸びになるかは追加検証が必要だ。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(未査読プレプリント)を開く