OpenAI Codex開発・コード確認済み

OpenAI検証:AI評価は設定2つで3倍変わる——GPT-5.6 SolのARC-AGI-3得点13.3%→38.3%、出力は6分の1

過去の推論を保持し、長い履歴を要約するcompactionを有効化。モデル比較では実運用と同じ実行環境の確認が重要だと示した。

  • 2026-07-29
  • 最終確認日 2026-08-04
自分にどう関係する?

AIランキングはモデルだけでなく実行環境も測っています。製品選びや社内評価で、履歴管理とAPI設定を確認する重要性が分かります。

ニュースをやさしく解説

結論から言うと、同じAIモデルでも、過去の考えを残すか、長い履歴をどう縮めるかという実行設定だけで評価点が約3倍変わるとOpenAIが報告した。2026年7月29日の公式検証は、未知の2Dゲームを説明なしで学ぶ「ARC-AGI-3」でGPT-5.6 Solを調べた。

公式の汎用実行環境では、各操作の後に非公開の推論が捨てられ、履歴が17万5000文字を超えると古い操作から削られていた。そのためAIは毎回ゲームの仕組みを考え直し、以前の発見も失いやすかった。OpenAIはResponses APIで、前回の推論を保持する設定と、古い履歴を単純削除せず要約する「compaction」を有効化した。

公開課題でのRHAE得点は13.3%から38.3%へ上がり、出力トークンは約6分の1になった。人間テスター平均の推定48%には届かないが、実行環境が結果へ大きく影響することが分かる。利用者には、AIを比べるときモデル名や平均点だけでなく、履歴、道具、API設定、費用を確認する必要があるという教訓になる。

ただし検証と推奨はOpenAI自身によるもので、他社モデルや別課題へ同じ伸びを保証しない。公平な比較には、各モデルに合う設定を公開し、第三者が再現できることが重要だ。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

OpenAI Research(公式検証)を開く