HierDoc(AI研究)検索・リサーチ確認済み

arXiv論文:長い文書を読むAIが「ページ→必要箇所」の2段階で証拠を選択——公開モデルの精度を最大16.87%改善

HierDocは関係ページを選んだ後、図表や段落の必要領域を抽出。LongDocURLで既存の最良公開モデルを相対16.87%上回った。

  • 2026-07-31
  • 最終確認日 2026-08-04
自分にどう関係する?

長いPDFや報告書をAIに読ませるとき、根拠ページと具体箇所を二段階で選ばせる設計の有効性を示します。

ニュースをやさしく解説

結論から言うと、何十ページもある文書へ質問するAIは、最初に関係ページを探し、その中の必要な図表や段落を絞る2段階方式で正確さを上げられると報告された。2026年7月31日にarXivへ提出された未査読プレプリントは、長文書の画像質問応答向け手法「HierDoc」を提案した。

従来はページ全体を探す方法と、あらかじめ渡されたページ内の小領域を探す方法が別々に作られることが多く、証拠選びがつながっていなかった。HierDocでは、1つ目の方針AIが文書全体から証拠ページの集合を選ぶ。次に各ページを見出し、段落、表、画像などへ分け、2つ目の方針AIが回答に必要な領域を選ぶ。

最終回答AIには、選んだページ全体に加え、領域の切り抜きとOCR・表の文字も渡すため、全体の流れと細部を両方確認できる。評価ではLongDocURLで、報告済みの最良オープンウェイト方式より相対16.87%改善した。領域情報を足す効果だけでも、ページのみの方式よりAccuracyが5.51%、F1が4.82%上がった。

利用者には、契約書や報告書をAIに読ませる際、答えだけでなく根拠ページと箇所を段階的に示す設計が役立つ。ただし査読前で、比較は評価用データ上の結果であり、OCR誤りや実文書の機密管理は別問題として残る。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(未査読プレプリント)を開く