内存瓶颈:为何统一内存优于GPU显存用于本地AI
苹果在M5 Ultra上的真正卖点并非原始算力,而是内存。该芯片采用全新的四芯片UltraFusion设计,将四个芯片整合为一个36核CPU和80核GPU,共享高达512GB的统一内存池,带宽达1.2TB/s,比前代M3 Ultra高出50%[1]。这一区别至关重要,因为当前前沿的开源权重模型——参数规模在700亿至4000亿以上——根本无法装入典型消费级GPU的显存中[4]。通过将CPU、GPU和神经引擎置于同一可寻址内存池中,而非将计算与较小的专用显存分离,苹果使得单台Mac Studio即可容纳并运行原本需要多块企业级GPU的模型。苹果自己的基准测试称,M5 Ultra的峰值AI算力最高可达M3 Ultra的4.3倍,是初代M1 Ultra的9.8倍,大语言模型提示处理速度比初代芯片快9.8倍[4]。更小的M6 Mac mini也采用了类似理念的简化版本——首款2纳米制程芯片,配备12核CPU、12核GPU和双16核神经引擎——但其统一内存带宽上限约为170GB/s,仅为Ultra版本的零头[1][3]。这两个数字之间的差距实质上构成了苹果的产品阶梯:购买更高的带宽和内存余量,就等于购买了本地运行更大模型的能力。



