EMNLP 2026論文:プロンプトを47%短くして平均精度3.76ポイント改善するESPO
失敗の分類、候補の多様化、安定性の確認を分け、長すぎる自動改善プロンプトを抑える手法です。
長く複雑になったプロンプトを整理しながら、改善案を安定して選ぶ実践的な手順として参考にできます。
ニュースをやさしく解説
結論から言うと、AIへの指示文を自動改善すると注意書きが増え続ける問題に対し、短さと精度を両立する「ESPO」が提案されました。2026年9月3日にarXivへ公開され、EMNLP 2026で発表予定の論文です。ESPOは改善作業を3段階に分けます。
まず学習中の失敗を一度に集めて型ごとに診断し、次に偏りの異なる4つの方法で候補を作り、最後にデータを繰り返し抽出するブートストラップで安定した案を選びます。Tweet、MMLU、GSM8K、HotpotQAなど公開7評価で、平均精度は従来のGEPAの70.91%から74.67%へ3.76ポイント上がり、指示文の長さは1878文字から1004文字へ47%短くなりました。
追加の4モデルでも平均精度が最良で、特にQwen3 32BのGSM8Kでは15.00%から91.40%へ上がったと報告しています。一方、候補を多様にするだけで安定性を確認しない条件では性能が1.20ポイント下がりました。
仕事でプロンプトを改善する人は、失敗のたびに規則を追記するのではなく、誤りを分類し、複数案を同じ評価データで比べ、結果が偶然でないか反復確認する手順を参考にできます。ただし大幅な向上幅は特定モデルと課題の組み合わせであり、自社データで再現するとは限りません。比較数値と発表先は論文要旨に基づきます。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。