研究論文検索・リサーチ確認済み

arXiv論文:金融AIは経験で最大19.37点向上——120課題で自己改善と規則違反を評価

金融6分野・20場面を続けて解くFinEvo-Benchを提案。4種類の仕組みで、経験保持による改善と規則違反を比較した。

  • 2026-08-09
  • 最終確認日 2026-08-09
自分にどう関係する?

AIの記憶やスキルが本当に次の仕事を良くしたかを、品質と規則順守の両方で測る参考になります。

ニュースをやさしく解説

結論から言うと、AIエージェントが前の仕事の経験を次の仕事へ生かせるかを、金融の実務に近い流れで測る評価「FinEvo-Bench」が公開された。2026年8月6日にarXivのcs.AIへ投稿された未査読プレプリントで、金融6分野、20の業務場面、実例に基づく120課題を収録する。

同じ手順を使う6件の異なる事例を各場面に置き、業務品質と金融上の規則順守を人が確認した評価表で採点する。研究では共通のQwen3.7-Maxを土台に4種類の自己改善する仕組みを比べ、課題順も3通りに入れ替えた。Lettaは経験を反映した後の点数が91.65で最も高く、規則上の問題は1課題あたり0.09で最少だった。

Codexは経験を持たない対照条件からの伸びが19.37点で最大だった。4方式すべてで、経験を残す条件は点数を9.33〜19.37点上げ、規則上の問題を0.12〜0.44件減らした。仕事でAIを育てる人には、単発テストだけでなく、似た業務を続けた時の改善と違反を同時に測る考え方が役立つ。

ただし採点の一部にはClaude CodeとClaude Opus 4.6を使い、対象は金融業務に限られる。未査読であり、製品の一般的な優劣を決める結果ではない。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(cs.AI、未査読プレプリント)を開く