更努力工作的代价
谷歌将Gemini 3.8 Flash在基准测试中的提升归因于模型在复杂任务上“更努力工作”,即采取额外推理步骤并迭代调用工具,而不是一次性作答[1]。这种策略是有成本的:Artificial Analysis发现,在3.8 Flash上运行其完整的Intelligence Index套件比在3.7 Flash上贵约40%——每项任务从0.40美元升至0.58美元——这主要由输出token数量增加约30%以及代理评估中更多的交互轮次所驱动[2]。换句话说,部分性能提升实际上是靠消耗更多token买来的,而非纯粹能力跃升。Reddit的r/singularity社区在发布数小时内独立得出了类似结论,指出该模型消耗的token甚至超过前代,并调侃称谷歌基本上是通过让模型花更多token来购买性能。同一讨论还提出了更尖锐的担忧:该模型在Terminal-bench 2.1上标榜的89.4%得分[3],在面对更新、更具挑战性的Terminal-bench 4.0套件时显得逊色许多——这是一个实时的、由公众推动的案例,展示了发布当天的基准声明被审查的速度之快。



