保留推理与压缩功能的实际作用
官方 ARC-AGI-3 评估在每次移动后都会清除模型的工作记忆:它会丢弃模型的私有推理过程,并且一旦运行历史超出上下文窗口,也会删除早期操作,迫使模型在每一回合都从头重新理解游戏环境[2]。OpenAI 的解决方案是 Responses API 中的两个设置:保留推理(Retained Reasoning),即当开发者传递前一次响应 ID 时,思维链可在各回合间持续保留;以及压缩(Compaction),即对较早的上下文进行摘要,而非截断或丢弃[1]。当这两个功能同时启用时,GPT-5.6 Sol 在 ARC-AGI-3 公共任务集上的得分从官方基准的 7.8–13.3% 区间跃升至 38.3%,同时每局游戏的输出 token 数量减少了约六倍[1][2]。



