那款快74倍的芯片——但或许已落后于时代
Taalas的核心创新是物理层面的,而非在现有芯片上叠加架构巧思:其HC1芯片在台积电6nm工艺上,于815平方毫米的芯片上蚀刻约530亿个晶体管,将Meta的Llama 3.1 8B模型的权重直接嵌入CMOS硅片,而非在每次前向传播时从HBM内存中读取 [1]。这一单一设计选择消除了限制GPU推理吞吐量的内存带宽瓶颈,其效果并非渐进式提升:HC1在相同模型上实现了每用户每秒高达17,000个token,而Nvidia H200仅约230个token/秒——差距约74倍;Cambrian AI的Karl Freund独立测试结果落在每秒14,357至16,960个token之间,基本验证了AMD与Taalas公布的数据 [2]。
但速度的代价是永久性。由于模型权重是电路的物理组成部分,升级到更新或更大的模型意味着必须更换芯片,而非推送软件更新——这种刚性是GPU加速器所不具备的。这也正是对该交易最尖锐质疑的来源:Reddit上一篇详细技术分析指出,自Taalas于2023年成立以来,“将模型固化在硅片中”的前提已显著削弱,因为生产环境中的上下文窗口已从不足4,000个token增长至128,000至1,000,000个token——而不断增长的KV缓存无法蚀刻进固定电路,必须依赖大容量、灵活的片上SRAM,这更接近Cerebras晶圆级芯片已实现的方案。换言之,AMD可能正在收购一款针对两年前AI部署模式优化的芯片,而非应对当前长上下文、代理式工作负载主导需求的未来——这一矛盾在AMD和Taalas的官方声明中均未提及,尽管也有评论者提出,某些特定场景下这种权衡仍具价值,例如实时翻译或低延迟机器人控制回路等对速度和功耗敏感、而非追求前沿智能的固定前端模型。


