决定账单的是框架,而非模型
TrueFoundry 的核心主张是,智能体成本主要是一个系统架构问题,而非模型定价问题。其基准测试采用了来自 DevRev Enterprise-Bench 的14个跨系统企业级任务,在三个 MCP 工具服务器(CRM、项目跟踪器、文档存储)上运行,每个任务使用独立会话,并由盲评的LLM裁判打分[1]。在相同的 Opus 4.8 流量下,TrueForge 每次运行成本为8.50美元,而 Claude 托管智能体为11.80美元——便宜约30%,同时消耗380万token,延迟约40分钟,相比之下托管方案消耗1000万token,延迟63分钟[1]。在同一基准测试中测试的第三个框架“deepagents”成本最高,每次运行达21美元,消耗1650万token[1]。TrueFoundry 将差距归因于更少且时机更优的模型调用以及上下文压缩机制,而非重复发送整个对话历史——框架决定模型下一步需要看到什么内容,而不是每轮都重发全部信息。三套系统的准确率彼此相差不到一个任务,因为底层模型决定了性能上限;差异完全体现在框架实现目标的效率上[1]。


