10万token的陡坡:多出2%的文本意味着5倍的账单
Haiku 5.5的定价在规格表上看似简单——10万token以内的提示,每百万输入token收费$0.10,每百万输出token收费$0.50 [2]——但这一统一费率在一道硬性门槛处戛然而止。一旦超过10万token,价格便跃升五倍,达到每百万token $0.50输入/$2.50输出 [2]。该模型扩展后的100万token上下文窗口 [3]意味着现在技术上可以输入比该门槛长十倍的提示,这使得在处理长文档、聊天记录或多文件代码库时,很容易意外越过这一阈值。社区讨论中引用的独立测试发现,实际影响极为严苛:仅比10万token多出一点的提示,其成本可能比刚好低于该阈值的提示高出约五倍,尽管实际文本仅增长了几个百分点。一种技术性反驳认为,这一陡坡并非随意设定——它可能反映了真实的推理经济学,即当请求超出模型高效的KV缓存窗口后,预填充(prefill)和解码(decode)成本的扩展方式不同,而较小的模型可能比大型模型更受这种扩展的影响。无论如何,这一陡坡将提示长度的预算管理变成了一项成本控制纪律,而在Haiku 4.5更平缓但更高价的结构下,这一点远没有那么重要。


