更快更便宜,但独立基准测试称并未更聪明
Google对2026年7月21日发布的官方说法是效率提升:根据Artificial Analysis Index,Gemini 3.6 Flash相比3.5 Flash减少了17%的输出token使用量,Google称在某些编码基准测试中token消耗最多减少了65% [1],定价为每100万输入token 1.50美元,每100万输出token 7.50美元 [1]。Gemini 3.5 Flash-Lite是两款公开定价模型中成本最低的,运行速度为每秒350个输出token,每100万输入token 0.30美元,每100万输出token 2.50美元 [3]。Google自身的编码基准测试显示相比上一代有显著提升:DeepSWE代码编辑准确率从37%提升至49%,MLE Bench从49.7%提升至63.9% [2],OSWorld-Verified从78.4%提升至83.0% [1]。但这些是编码工作流和效率指标,而非通用智能评分,这正是独立观察者所关注的差异。AlphaSignal运行了其私有的调试测试集——在13项任务中对比8个其他前沿模型——Gemini 3.6 Flash在9个模型中排名第7,修复了65次尝试中的60次,但总token消耗量高于多个竞争对手。社区基准比较发现,3.6 Flash的智能水平与3.5 Flash基本持平,明显落后于Grok 4.5和GLM等竞争对手。Unite.AI的Jonas Reeve总结了战略判断:Google正在Flash层级上以价格和速度竞争,而‘真正能挑战市场顶端的模型仍未面世,而竞争对手已陆续发布’ [4]。若将其视为一次‘tick-tock’周期——交替发布以效率换取智能提升的版本——此次发布属于效率提升的一半:对高吞吐量的代理和编码工作负载确实有用,但并非某些人期待的前沿能力飞跃。


