GPT-5.6 Sol ARC-AGI-3 分数通过 API 设置实现三倍增长
TECH

GPT-5.6 Sol ARC-AGI-3 分数通过 API 设置实现三倍增长

23+
Signals

战略概览

  • 01.
    OpenAI 报告称,在其 Responses API 中启用两个设置——保留推理(Retained Reasoning)和压缩(Compaction)——使 GPT-5.6 Sol 在 ARC-AGI-3 公共任务集上的得分提高了三倍,同时每局游戏使用的输出 token 数量减少了约六倍。
  • 02.
    在官方 ARC-AGI-3 测试框架下,GPT-5.6 Sol 在公共任务集上的得分为 13.3%;而使用启用了保留推理和压缩功能的 OpenAI Responses API 后,同一模型的得分达到 38.3%。
  • 03.
    GPT-5.6 Sol 在标准化 ARC Prize 测试框架下的官方验证得分为 7.78%(最大推理努力),是首个赢得 ARC-AGI-3 公共游戏的模型。
  • 04.
    OpenAI 声称,在启用保留推理和压缩功能后,GPT-5.6 Sol 的 38.3% 分数超过了 Claude Opus 5 在 ARC-AGI-3 上的官方得分为 30.2%。
  • 05.
    Claude Opus 5 的官方验证 ARC-AGI-3 分数为 30.16%(高推理努力),是迄今为止该基准测试中记录的最高分数,并完成了五个此前任何模型都未能击败的环境。
  • 06.
    在官方、未经调整的测试框架中,GPT-5.6 Sol 得分为 7.8%,而上一代 GPT-5.5 仅得 0.4%。

保留推理与压缩功能的实际作用

官方 ARC-AGI-3 评估在每次移动后都会清除模型的工作记忆:它会丢弃模型的私有推理过程,并且一旦运行历史超出上下文窗口,也会删除早期操作,迫使模型在每一回合都从头重新理解游戏环境[2]。OpenAI 的解决方案是 Responses API 中的两个设置:保留推理(Retained Reasoning),即当开发者传递前一次响应 ID 时,思维链可在各回合间持续保留;以及压缩(Compaction),即对较早的上下文进行摘要,而非截断或丢弃[1]。当这两个功能同时启用时,GPT-5.6 Sol 在 ARC-AGI-3 公共任务集上的得分从官方基准的 7.8–13.3% 区间跃升至 38.3%,同时每局游戏的输出 token 数量减少了约六倍[1][2]

一个本意就是防止此类调整的基准测试

ARC-AGI-3 在每一步之间丢弃推理过程,正是为了确保分数反映的是模型自身的解题能力,而非累积的上下文或测试框架工程技巧[2]。OpenAI 的设置重新引入了标准化评估本意要排除的连续性,然后利用由此产生的分数声称 GPT-5.6 Sol 超过了 Claude Opus 5。ARC Prize 联合创始人 Francois Chollet 的回应区分了不公平的“定制化”测试框架与合法的“通用 API 设置……可供所有 API 用户使用”——但他强调,这种接受的前提是相关设置和成本必须明确披露[3]。这一接受需要附加披露条件本身,就表明这两种评估并非衡量同一事物。

已经发生的超越

时间点至关重要。GPT-5.6 Sol 在最大推理努力下的官方验证 ARC-AGI-3 分数为 7.78%[4]。就在 OpenAI 发布其设置文章的几天前,Claude Opus 5 在高推理努力下创下了新的官方纪录 30.16%(30.2%),并由 ARC Prize 验证为迄今为止该基准测试中的最高分[5]。OpenAI 发布的 38.3% 数据是在该纪录之后公布的,被表述为击败了 Opus 5——但 Opus 5 从未在相同的“保留推理+压缩”配置下运行过,因此这一比较实际上是将一个模型的定制化测试框架与另一个模型的标准化框架进行对比[3]

这对未来阅读 AI 基准测试的启示

同一模型权重在不同条件下产生了近五倍的分数差异——标准测试框架下为 7.8% 至 13.3%,而在 OpenAI 自有设置下达到 38.3%——这意味着测试框架和 API 配置的重要性可能不亚于被测试的模型本身[1][6]。正如某媒体总结的底层逻辑:“评估很少真正孤立地测试模型。它们也受到 API 设置和测试框架设计的影响。”[6]未来任何实验室声称“模型 X 在基准测试中击败模型 Y”,都应被理解为“模型+测试框架+设置”的综合声明,而非仅关于模型本身。

历史背景

GPT-5.6 系列(Sol、Terra、Luna)发布,其中 Sol 被定位为 OpenAI 的旗舰推理与代理模型。
Claude Opus 5 在 ARC-AGI-3 上创下新的官方纪录 30.2%,几乎是 GPT-5.6 Sol 在标准化评估下此前官方纪录 7.8% 的四倍;该结果已由 ARC Prize 验证。
ARC-AGI-3 是第三代抽象与推理语料库基准,是一种交互式推理评估,旨在衡量前沿模型仍远未达到饱和的流体性、新颖问题解决能力。

关键关系图

关键玩家
主题

GPT-5.6 Sol ARC-AGI-3 分数通过 API 设置实现三倍增长

OP

OpenAI

模型开发者;发布了声称分数三倍增长的博客文章,并使用其自有 Responses API 设置与 Claude Opus 5 进行比较

AN

Anthropic

Claude Opus 5 的开发者,其在 ARC-AGI-3 上保持官方纪录(30.2%),而 OpenAI 的非标准结果声称已超越该纪录

AR

ARC Prize Foundation / Francois Chollet

运营官方、标准化的 ARC-AGI-3 基准测试与评估框架;ARC Prize 联合创始人 Chollet 公开评论了可接受的通用 API 设置与不公平的定制化测试框架之间的区别

事实来源

6 条引用
  1. [1] OpenAI Says GPT 5.6's Score On ARC-AGI 3 Tripled After Turning On Two API Settings
  2. [2] OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 with its latest API and two additional settings
  3. [3] OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 but only with its own custom test harness
  4. [4] GPT-5.6 Sol Results
  5. [5] Claude Opus 5 Results
  6. [6] OpenAI Triples Benchmark Scores With Simple Settings

来源文章

Top 4

THE SIGNAL.

Analysts

Chollet 区分了不公平的“定制化”测试框架与可接受的“通用 API 设置……可供所有 API 用户使用”,同时强调这种接受的前提是相关设置和成本必须明确披露。

Francois Chollet (ARC Prize co-founder)
区分了不公平的定制化基准测试框架与合法的通用 API 设置
The Crowd

OpenAI says two API settings raised GPT-5.6 Sol’s ARC-AGI-3 public-set score from 13.3% to 38.3%. And this happened because, the ARC-AGI official evaluation kept wiping 5.6 Sol's working memory. i.e. it discarded private reasoning after every move and later removed older actions once the running history exceeded its window.

@@rohanpaul_ai44

Is GPT‑5.6 Sol now better than Opus 5 on ARC‑AGI‑3? Short answer: not on the official leaderboard, but the comparison is more complicated than it first appeared. let me explain, because there is a bit of confusion. ARC‑AGI‑3 tests whether models can learn unfamiliar 2D games through trial and error...

@@kimmonismus440

Opus 5 just jumped the ARC-AGI-3 score from 7.8% to 30.2% The previous score was GPT-5.6 Sol, which came out..... two weeks ago.

@@BenjaminDEKR35

Tibo addresses 5.6 Sol Score on ARC-AGI-3

@u/Apple_macOS272
Broadcast
Ep 126: OpenAI's GPT-5.6 Sol just tripled its ARC-AGI-3 score using two API settings that also cut output tokens by six times

Ep 126: OpenAI's GPT-5.6 Sol just tripled its ARC-AGI-3 score using two API settings that also cut output tokens by six times

OpenAI is so back... GPT 5.6 Sol first look

OpenAI is so back... GPT 5.6 Sol first look

GPT 5.6 SOL y NUEVO KIMI 3 ¡La IA AGÉNTICA ya es REAL!

GPT 5.6 SOL y NUEVO KIMI 3 ¡La IA AGÉNTICA ya es REAL!