OPENAI / AGENT EVALUATION

OpenAI が ARC-AGI-3 のスコアを約3倍にした理由は、モデルの変更ではない

同じ GPT-5.6 Sol、同じ公開ゲームセットで、コンテキストに関する二つの設定を変えるとスコアは 13.3% から 38.3% になった。ここで重要なのは「モデルが急に賢くなった」ことではない。agent の動かし方も、評価結果の一部だということだ。

⚑ これは OpenAI が 2026年7月29日に公開した実験の解説です。数値は Responses API を用いた OpenAI 自身の ARC-AGI-3 公開セット再現結果であり、独立した第三者の再現ではありません。すべてのモデルやタスクが同じ倍率で改善することも意味しません。
13.3%
公式の汎用 harness での RHAE スコア
38.3%
推論保持と compaction を有効にした結果
約6×
OpenAI が報告した出力 token の削減量
二つの harness における ARC-AGI-3 スコアと出力 token の比較
図1:OpenAI 原文の数値に基づく再描画。公式の原画像ではありません。

変わったのはモデルではなく、システムの状態管理

ARC-AGI-3 では、agent が未知の二次元ゲームを探索する。ルールブックはなく、観察、操作、仮説、修正を長い手順の中で続ける必要がある。だから、過去の試行から何を持ち越せるかが本質的になる。

OpenAI が見つけた制約は二つだった。公式 harness はゲーム操作のたびに private reasoning を捨て、履歴が長くなると最も古い操作を rolling truncation で消す。直近の操作は見えても、その操作に至った仮説や計画は残らない。

公式の汎用 HARNESS
  • private reasoning を次のターンへ渡さない。
  • 古い履歴をローリング方式で削除する。
  • agent はゲーム理解を何度も作り直す。
OPENAI の再現 HARNESS
  • 推論を呼び出し間で保持する。
  • 古い履歴は削除せず、要約して圧縮する。
  • 仮説、失敗経路、観察を次に持ち越せる。
rolling truncation と推論保持および compaction の比較
図2:OpenAI 原文のコンテキストウィンドウの説明を再構成した図。

二つの設定は何を直したのか

推論の保持:次の操作に「なぜそう考えたか」を渡す

ツール出力だけを次のターンへ渡しても、作業中の仮説までは残らない。多段の探索では、これは操作ごとにルールを推定し直すのに近い。OpenAI は Responses API の前回応答を引き継ぎ、次の操作が前の推論を土台にできるようにした。

Compaction:古い文脈を消すのでなく、使える状態に畳む

truncation は長さを削除で管理する。compaction は目標、証拠、棄却した経路、未解決の問いを圧縮した状態として残す。完全な記憶ではないが、実行の先頭を忘れるのとは決定的に違う。

スコアが上がって token が減った理由

コンテキストを残すことは、必ずしも余計な推論を増やすことではない。OpenAI の説明では、agent は毎手の前に世界の理解を再構築しなくなった。すでに分かったことを繰り返す代わりに、次の不確実性に token を使える。そのため、モデルや予算を増やす前に、agent がどこで忘れているかを調べる価値がある。

ベンチマークが測るのはモデル単体であることは稀で、API 設定、harness 設計、prompt といった見えにくい選択も同時に測っている。
OpenAI 原文の要旨

agent 評価へ持ち帰ること

  • コンテキスト方針を能力として扱う。ツール履歴、判断、失敗理由を次のターンに渡す経路が必要だ。
  • runner を報告する。API、prompt、ツール、コンテキスト方針、予算はスコアと一緒に示すべきだ。
  • compaction と単純な切り捨てを同一視しない。有用な要約は制約、検証済みの事実、未解決の分岐を残す。
  • 評価の問いを明確にする。最小の標準 harness と本番 agent システムは、どちらも有効だが別の問いに答えている。
出典と限界。OpenAI「How enabling two settings tripled our scores on the ARC-AGI-3 benchmark」に基づく。スコア、token、人間ベースラインへの言及はすべて OpenAI の報告または推定である。方法論の全文は 原文を参照してください。