效率主张及其隐藏的局限性
Reflection AI 的核心主张是,Beam 在高级推理基准测试上的表现与 Z.ai 的 GLM-5.2 相当,但推理计算资源消耗仅为后者的三至四分之一[1]。然而,Reflection 自身也表示该数据是一种近似比较而非精确测量[1],外部技术分析指出,这种对比似乎排除了提示词预填充、上下文相关注意力机制和服务开销等[3]——这些正是决定模型在生产环境中实际运行成本的关键现实因素,而不仅仅是在基准测试表中的表现。效率论点基于 Beam 的专家混合架构:其5010亿参数中每次仅激活230亿,相比之下,DeepSeek V4 Pro 激活490亿参数[1]。这种更小的活跃参数规模从架构上看是真实且可验证的;但针对 GLM-5.2 的3-4倍计算节省说法目前尚无法成立,至少在公开权重发布前,独立测试者只能通过厂商授权访问进行测试[3]。


