arXiv論文:AIエージェントの失敗を約200マイクロ秒で検知・再実行——成功率52%から73%へ
2,823回の実行記録から軽量監視と決定的検証を比較。失敗を検知して巻き戻す仕組みが、単純な再試行より高い回復率を示した。
news
AI比較、AIニュース、AI利用、AI議事録づくりまで、生成AIの最新情報を出典つきで整理します。ChatGPT、Claude、Geminiなどは親AIファミリー別にまとめて確認できます。
search intent
AI比較、AIニュース、AI利用、AI議事録の目的別に、次のページへすぐ移動できます。
newly checked
ニュースを読む前に、最近確認したAIも見直せます。
AIファミリー別
GPT-5.6、o3、CodexはOpenAI / ChatGPTにまとめます。2,823回の実行記録から軽量監視と決定的検証を比較。失敗を検知して巻き戻す仕組みが、単純な再試行より高い回復率を示した。
2つのAIを比較する途中結果に、事前の判定規則と保留を追加。3つの公開評価では全課題の15〜25%で最終判断と一致した。
簡単な質問を多段階の調査課題へ自動発展させ、各手順と確認点をDAGで記録。10大カテゴリ・3形式を収録した。
児童生徒・教員の利用場面に6種類・28小分類の危険を組み合わせ、1回の質問から動的な長い会話まで評価した。
別の9Bモデルが失敗記録から検証済みパッチを作成。WebShopなど3評価で、Qwen 3.5 9Bの課題成功率を9.3ポイント改善した。
自然文の目標を機械検査できる仕様へ変換し、複数の探索法で候補を提案・試験・改善するAtumAIを発表した。
quick answers
比較、AI名での絞り込み、議事録AIへの進み方を短く確認できます。
ランキングとカテゴリページで、無料枠、日本語対応、得意な作業、公式情報を見比べられます。
ChatGPT、GPT、o3、Codexのような表記ゆれはOpenAI / ChatGPTのように親AIファミリーへまとめて絞り込めます。
目的ページの「会議の議事録を作りたい」から、文字起こしAIと要約AIの組み合わせを確認できます。