AI研究検索・リサーチ確認済み

arXiv論文:数百ページの手順書をたどるAI、医療コードの完全正答は最高1%——TAM

何万もの規則を順番に適用する現実的な課題では、GPT-5を使った方式でも完全正答が低水準でした。

  • 2026-09-15
  • 最終確認日 2026-09-15
自分にどう関係する?

AIに長い社内規程や手順書を読ませるとき、検索だけでなく規則を順番どおり適用できたかの確認が必要だと分かります。

ニュースをやさしく解説

結論から言うと、AIが短い問題で高得点でも、数百ページの手順書から必要な規則を探し、正しい順番で適用する仕事はまだ安心して任せられません。2026年9月11日にarXivへ公開されたプレプリント(会議名の記載なし)は、長い手続きを評価するベンチマーク「Tasks over Application Manuals(TAM)」を提案しました。

題材は、病名などをICD-10-CMの診断コードへ対応させる医療コーディングと、米国連邦量刑指針から犯罪のオフェンスレベルを計算する2分野です。どちらも権威あるマニュアルに何万もの規則があり、離れた章を参照しながら、前の判断に依存する手順を続けて完全一致の答えを出します。

研究者は人が確認した正解を用意し、検索拡張生成(RAG)、考えながら道具を使うReAct型、AIエージェント用の実行環境など、GPT-5を使う一般的な方法を比較しました。しかし最高の完全一致率は医療コーディングで1%、量刑課題で15.5%でした。

利用者にとっては、社内規程、申請、法務や医療のような長い手順をAIへ任せる際、もっともらしい途中説明ではなく、規則ごとの根拠と最終結果を人が照合する必要があると分かります。ただし、結果はTAMの2分野と特定の設定に限られ、すべてのAIや手順業務の性能を示すものではありません。査読状況は明記されておらず、出典はarXivの論文要旨です。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXivプレプリント(会議名の記載なし)を開く