为何 AMD 和 Cerebras 将推理流程一分为二
AMD 的 Helios 机架级平台与 Cerebras 的晶圆级引擎(WSE)并非被简单地拼接成单一的巨型芯片——它们将推理流程拆分为两个专业化的阶段。Helios 负责预填充(prefill):即高吞吐量、大上下文窗口的提示处理任务,72 块 Instinct MI455X GPU 和 31TB HBM4 内存在此类任务中表现出色。Cerebras WSE 则接管解码(decode):即对内存带宽要求极高的 token 生成过程,这决定了聊天机器人或智能体对用户而言的响应速度有多快 [1]。这种分工反映了生产级推理团队用实践得出的教训——单一加速器架构很少能同时优化这两个阶段,因此将预填充与解码任务在专用硅芯片上解耦,如今成为这两家公司实现大规模超低延迟服务的解决方案 [1]。



