arXiv論文:企業文書を読むAIを4869ページで比較——長い一覧は欠落しやすく、精度と費用に大差
370文書・8業種・67種類を使い、値の正確さ、抜け、出典位置、費用を同時評価するExtractBenchを公開。
PDFや請求書の転記をAIに任せるとき、値が合っていても途中の行が抜けることがあります。件数と根拠ページの確認が重要です。
ニュースをやさしく解説
結論から言うと、請求書や報告書からAIに項目を抜き出させる仕事では、短い文書で高精度でも、長い一覧になると途中の行を落とす場合があり、出典位置と費用まで見て選ぶ必要がある。2026年7月31日にarXivへ提出された未査読プレプリントは、企業文書抽出の評価基盤「ExtractBench」を公開した。評価対象は8つの業務分野、67種類、計370文書の4869ページ。
利用者が指定した項目表に従って値を返す課題で、値の正確さだけでなく、全レコードを取り切れたか、根拠が何ページの何語にあるか、処理費用も同時に測る。正解データは、実文書では独立した複数システムの一致、合成一覧では既知の値、フォームでは人の確認を組み合わせて作った。実験では商用の画像・文書理解モデルは短い文書に強い一方、長いレコード一覧を途中で切る傾向があった。
コード実行型エージェントは精度を保ちやすいが費用が高く、LlamaExtract Agentic Plusが3つの主要指標で首位となり、コード実行型に近い精度をより低い費用で示した。利用者は、AIに表を作らせた後、合計件数と最初・最後の行、根拠ページを確認すると欠落を見つけやすい。ただし論文要旨は全モデルの具体的な料金や点数を示しておらず、機密文書での安全性も別問題だ。
出典はarXiv原論文で、査読前の結果として扱いたい。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。