OpenAI検証:AI評価は設定2つで3倍変わる——GPT-5.6 SolのARC-AGI-3得点13.3%→38.3%、出力は6分の1
過去の推論を保持し、長い履歴を要約するcompactionを有効化。モデル比較では実運用と同じ実行環境の確認が重要だと示した。
AIランキングはモデルだけでなく実行環境も測っています。製品選びや社内評価で、履歴管理とAPI設定を確認する重要性が分かります。
ニュースをやさしく解説
結論から言うと、同じAIモデルでも、過去の考えを残すか、長い履歴をどう縮めるかという実行設定だけで評価点が約3倍変わるとOpenAIが報告した。2026年7月29日の公式検証は、未知の2Dゲームを説明なしで学ぶ「ARC-AGI-3」でGPT-5.6 Solを調べた。
公式の汎用実行環境では、各操作の後に非公開の推論が捨てられ、履歴が17万5000文字を超えると古い操作から削られていた。そのためAIは毎回ゲームの仕組みを考え直し、以前の発見も失いやすかった。OpenAIはResponses APIで、前回の推論を保持する設定と、古い履歴を単純削除せず要約する「compaction」を有効化した。
公開課題でのRHAE得点は13.3%から38.3%へ上がり、出力トークンは約6分の1になった。人間テスター平均の推定48%には届かないが、実行環境が結果へ大きく影響することが分かる。利用者には、AIを比べるときモデル名や平均点だけでなく、履歴、道具、API設定、費用を確認する必要があるという教訓になる。
ただし検証と推奨はOpenAI自身によるもので、他社モデルや別課題へ同じ伸びを保証しない。公平な比較には、各モデルに合う設定を公開し、第三者が再現できることが重要だ。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- スクール無料カウンセリングを見る ↗Winスクール|資格・AI/Pythonに強い個人レッスンAI・Python・Webを本気で学んで仕事・転職につなげたい人向け全国校+オンラインの個人レッスン型スクール。目的別コースを無料カウンセリング・受講相談で相談できます。
- スクール無料個別相談を見る ↗Wannabeアカデミー|3ヶ月でWEBマーケターAIを武器にWEBマーケ・広告運用で副業/転職したい人向け実務課題で学ぶWEBマーケター養成スクール。AI活用が前提の今、需要が高い集客スキルを無料個別相談から確認できます。
- Amazon評価順で探す ↗Amazon|Python×AIプログラミング入門書を評価順で探すAIを使ったコード生成・自動化・ローカルLLM活用へ進みたい人向けPython、AI開発、Copilot/Cursor活用の周辺教材をレビュー評価順で確認できます。環境構築の難易度も見て選べます。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。