研究論文検索・リサーチ確認済み

arXiv論文:780ページの表検索、埋め込みRAGの15.7%に対しREADは58.8%——単位切断を回避

長文を分割して近い断片を取る方式の弱点を測定。文字検索・構造移動・範囲読み取りを監査可能な操作として提案した。

  • 2026-08-09
  • 最終確認日 2026-08-09
自分にどう関係する?

表の多い長文をAIで調べる時は、数字と単位・年度が同じ文脈にあるかを元資料で確認する必要があります。

ニュースをやさしく解説

結論から言うと、表が多い長い文書では、文章を小分けにして意味の近い断片を上位から取る一般的なRAGが、数字の単位や年度を切り離してしまう場合がある。2026年8月6日にarXivのcs.AIへ投稿された未査読プレプリントは、780ページの政府財務報告書を調べた。

内容行の86.8%が表の行で、数字が受け継ぐ単位の見出しは中央値で13行上にあったため、分割位置によって数値と単位が離れやすい。表を意識した分割法でも、数値を含む断片の27〜30%には会計年度の見出しが残らなかった。研究チームはREADを提案し、正規化した文字検索、文書構造の移動、長さを制限した範囲読み取りの3操作をMCP経由でAIに渡した。

確認済み51問ではREADの正答率が58.8%、密な埋め込み検索は15.7%で、調整後の35.3%と比べてもREADが23.5ポイント上回った。同じ反復処理でTop-K道具を使うAIは27.5%だった。利用者には、決算書や監査資料で数字を調べる時、検索結果だけでなく見出し・単位・年度を元ページで確認する大切さが分かる。

ただしBM25とREADの差は統計的に明確でなく、研究も一つの文書と51問が中心だ。エージェント方式が文字検索全般より優れると証明した結果ではない。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(cs.AI、未査読プレプリント)を開く