AI研究検索・リサーチ確認済み

EMNLP 2026論文:プロンプトを47%短くして平均精度3.76ポイント改善するESPO

失敗の分類、候補の多様化、安定性の確認を分け、長すぎる自動改善プロンプトを抑える手法です。

  • 2026-09-04
  • 最終確認日 2026-09-04
自分にどう関係する?

長く複雑になったプロンプトを整理しながら、改善案を安定して選ぶ実践的な手順として参考にできます。

ニュースをやさしく解説

結論から言うと、AIへの指示文を自動改善すると注意書きが増え続ける問題に対し、短さと精度を両立する「ESPO」が提案されました。2026年9月3日にarXivへ公開され、EMNLP 2026で発表予定の論文です。ESPOは改善作業を3段階に分けます。

まず学習中の失敗を一度に集めて型ごとに診断し、次に偏りの異なる4つの方法で候補を作り、最後にデータを繰り返し抽出するブートストラップで安定した案を選びます。Tweet、MMLU、GSM8K、HotpotQAなど公開7評価で、平均精度は従来のGEPAの70.91%から74.67%へ3.76ポイント上がり、指示文の長さは1878文字から1004文字へ47%短くなりました。

追加の4モデルでも平均精度が最良で、特にQwen3 32BのGSM8Kでは15.00%から91.40%へ上がったと報告しています。一方、候補を多様にするだけで安定性を確認しない条件では性能が1.20ポイント下がりました。

仕事でプロンプトを改善する人は、失敗のたびに規則を追記するのではなく、誤りを分類し、複数案を同じ評価データで比べ、結果が偶然でないか反復確認する手順を参考にできます。ただし大幅な向上幅は特定モデルと課題の組み合わせであり、自社データで再現するとは限りません。比較数値と発表先は論文要旨に基づきます。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(EMNLP 2026)を開く