arXiv論文:複数リポジトリをまたぐコード教材「OctoLong」——長文教材の12%置換で理解力が向上
AST解析・言語サーバー・パッケージ管理で依存関係を追い、数百万トークン級のコード教材を構築。18モデルと比較した。
コードAIへ長文を与えるだけでなく、実際の依存関係をたどる教材設計が重要だと分かります。
ニュースをやさしく解説
結論から言うと、長いコードを読めるAIを育てるには、1つのファイルやリポジトリを長く並べるだけでなく、実際の依存関係をたどった教材が有効だとする研究が出た。2026年8月5日にarXivへ提出された未査読論文は、複数のリポジトリをまたぐコード文脈を作る仕組み「OctoLong」を提案した。
抽象構文木を読むAST解析器、定義や参照を探す言語サーバー、外部ライブラリを管理するパッケージ管理機能を組み合わせ、呼び出し先を再帰的に追跡。数百万トークン規模でも、離れた場所のつながりを含む教材を作る。
研究チームは6億〜140億パラメータのOctoLong-Instruct群を作り、約500億トークンの中間学習用データのうち約62億トークンをOctoLongにし、その後約100億トークンで指示学習した。
最先端の公開長文モデル18種類との比較と条件を変えた実験では、従来の長文教材の12%をOctoLongへ置き換えるだけで、遠距離の情報検索、長期状態追跡、リポジトリ理解、エージェント課題が改善し、短いコードでのAPI利用にも効果があったという。開発者には、大規模コードベース用AIの学習設計を見直す手掛かりになる。
ただし査読前で、要旨には各評価の点数や計算費用がなく、実務の非公開コードで同じ伸びになるかは追加検証が必要だ。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。