arXiv論文:数百ページの手順書をたどるAI、医療コードの完全正答は最高1%——TAM
何万もの規則を順番に適用する現実的な課題では、GPT-5を使った方式でも完全正答が低水準でした。
AIに長い社内規程や手順書を読ませるとき、検索だけでなく規則を順番どおり適用できたかの確認が必要だと分かります。
ニュースをやさしく解説
結論から言うと、AIが短い問題で高得点でも、数百ページの手順書から必要な規則を探し、正しい順番で適用する仕事はまだ安心して任せられません。2026年9月11日にarXivへ公開されたプレプリント(会議名の記載なし)は、長い手続きを評価するベンチマーク「Tasks over Application Manuals(TAM)」を提案しました。
題材は、病名などをICD-10-CMの診断コードへ対応させる医療コーディングと、米国連邦量刑指針から犯罪のオフェンスレベルを計算する2分野です。どちらも権威あるマニュアルに何万もの規則があり、離れた章を参照しながら、前の判断に依存する手順を続けて完全一致の答えを出します。
研究者は人が確認した正解を用意し、検索拡張生成(RAG)、考えながら道具を使うReAct型、AIエージェント用の実行環境など、GPT-5を使う一般的な方法を比較しました。しかし最高の完全一致率は医療コーディングで1%、量刑課題で15.5%でした。
利用者にとっては、社内規程、申請、法務や医療のような長い手順をAIへ任せる際、もっともらしい途中説明ではなく、規則ごとの根拠と最終結果を人が照合する必要があると分かります。ただし、結果はTAMの2分野と特定の設定に限られ、すべてのAIや手順業務の性能を示すものではありません。査読状況は明記されておらず、出典はarXivの論文要旨です。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。