验证鸿沟:722份手稿,仅有一个部分校验和
OpenAI发布中最引人注目的数字是722份手稿和372个结果家族,但对于任何试图评估这些主张的人来说,更关键的数字是63% [1]。这是带有Lean形式化的内容占比——一种机器可验证的证明骨架,旨在确认逻辑步骤无矛盾地编译。其余家族完全没有此类支撑结构,而OpenAI自己的清单将整个集合的状态标记为“部分进展”且“未经审查”,这一坦白令人震惊,尤其当该发布被包装为突破性成果时 [1]。
即使存在Lean形式化,它回答的问题也比大多数报道暗示的要窄。Lean检查只能确认给定前提能否通过有效逻辑步骤推导出结论;它无法判断前提是否正确设定、结果是否真正新颖,或是否实质解决了其所声称的开放问题 [2]。此外,OpenAI仅披露了部分计算信息——每项结果平均约三小时的ChatGPT Pro“思考”时间——却隐瞒了总成本、token数量、加速器使用时长、模型本身、其权重以及所用提示词 [1]。没有这些信息,独立数学家无法复现生成过程,只能审计其产出的静态文档。最终结果是一个表面详尽记录、但按公司自身说法仅部分验证的集合。



