1 比特量化感知训练的实际工作原理
大多数模型压缩发生在训练之后:你取一个训练完成的全精度模型,将其权重四舍五入为更低的比特宽度,并接受由此带来的精度损失。PrismML 采取了结构性不同的方法。他们的量化感知训练(QAT)将二进制或三进制权重约束直接嵌入训练过程本身——模型从一开始就学习到其权重只能是 -1、0 或 +1,并且每组 128 个权重共享一个 FP16 缩放因子 [8]。反向传播过程中保留全精度梯度,但前向传播在每一步都强制执行二进制或三进制约束。结果是模型在其表示方式上适应了极端比特宽度限制,而不是一个被粗略四舍五入的全精度模型。
这种区别对性能至关重要。在 1 比特级别进行训练后量化通常会破坏推理能力,因为模型从未被训练来补偿如此高压缩比下的信息损失。QAT 允许网络在训练期间将其 270 亿参数中的信息重新分布和编码,这正是 PrismML 能够声称其 1 比特版本在 15 项推理基准测试中保持 89.5% 性能、三进制版本保持 94.6% 性能的原因 [6]。这里的核心知识产权是多年在 Caltech 开发的数学理论,能够在不丧失推理能力的前提下压缩神经网络 [9]。基础模型——阿里巴巴 Apache 2.0 许可的 Qwen3.6-27B——提供了一个可访问的基础,使该技术流程得以在大规模上展示,而无需专有模型访问权限 [1]。


