PrismML Bonsai 27B 将 270 亿参数 AI 带入 iPhone
TECH

PrismML Bonsai 27B 将 270 亿参数 AI 带入 iPhone

33+
Signals

战略概览

  • 01.
    PrismML 于 2026 年 7 月 14 日发布了 Bonsai 27B,这是首款可在手机上运行的 270 亿参数模型。它包含两个版本:1 比特二进制版本大小为 3.9 GB,1.58 比特三进制版本为 5.9 GB,均基于阿里巴巴的 Qwen3.6-27B,并采用 Apache 2.0 许可证。1 比特版本在 iPhone 17 Pro 上可实现每秒 11 个 token,在 M5 Max 上可达每秒 87 个 token。
  • 02.
    压缩效果显著:1 比特版本从全精度下的 54 GB 缩减至 3.9 GB,压缩比达 14 倍,首次在该参数规模下适配 iPhone 约 6 GB 的应用内存限制。PrismML 声称其相比传统版本内存占用减少 10-15 倍,响应速度快 6-8 倍,能耗降低 3-6 倍,代价是在基准测试中整体性能损失约 10%。
  • 03.
    苹果公司正与 PrismML 进行早期谈判,评估其压缩技术是否可用于 iPhone 集成。PrismML 首席执行官 Babak Hassibi 在模型发布当天向 CNBC 公开证实了此事,而前一天苹果刚刚发布了搭载重大改版 Siri 的 iOS 27 公开测试版。
  • 04.
    PrismML 于 2026 年 3 月 31 日结束静默期,宣布获得由 Khosla Ventures、Cerberus Ventures、Google 和 Samsung 支持的 1625 万美元种子轮融资,其技术基于加州理工学院(Caltech)的专有知识产权。Bonsai 27B 是该公司首个旗舰级发布成果。

1 比特量化感知训练的实际工作原理

大多数模型压缩发生在训练之后:你取一个训练完成的全精度模型,将其权重四舍五入为更低的比特宽度,并接受由此带来的精度损失。PrismML 采取了结构性不同的方法。他们的量化感知训练(QAT)将二进制或三进制权重约束直接嵌入训练过程本身——模型从一开始就学习到其权重只能是 -1、0 或 +1,并且每组 128 个权重共享一个 FP16 缩放因子 [8]。反向传播过程中保留全精度梯度,但前向传播在每一步都强制执行二进制或三进制约束。结果是模型在其表示方式上适应了极端比特宽度限制,而不是一个被粗略四舍五入的全精度模型。

这种区别对性能至关重要。在 1 比特级别进行训练后量化通常会破坏推理能力,因为模型从未被训练来补偿如此高压缩比下的信息损失。QAT 允许网络在训练期间将其 270 亿参数中的信息重新分布和编码,这正是 PrismML 能够声称其 1 比特版本在 15 项推理基准测试中保持 89.5% 性能、三进制版本保持 94.6% 性能的原因 [6]。这里的核心知识产权是多年在 Caltech 开发的数学理论,能够在不丧失推理能力的前提下压缩神经网络 [9]。基础模型——阿里巴巴 Apache 2.0 许可的 Qwen3.6-27B——提供了一个可访问的基础,使该技术流程得以在大规模上展示,而无需专有模型访问权限 [1]

突破 6 GB 限制:iPhone 成为 AI 平台的关键门槛

iOS 在 12 GB 内存的 iPhone 上设定约 6 GB 的应用内存限制(iPhone 15 Pro 总内存为 8 GB)[6]。这一限制一直是区分可在手机运行与依赖云端的模型之间的硬性边界。此前的设备端模型必须远低于此限制,因此被限制在 70 亿至 90 亿参数范围内,仅适用于常规量化水平下的基本任务,无法达到让 AI 助手真正具备规划、编程和工具使用能力的推理层级。

1 比特 Bonsai 27B 仅占 3.9 GB,是首个突破该门槛且仍有余量的 270 亿参数级模型——‘大约 4 GB 的 1 比特 Bonsai 27B 是首个顺利通过并留有操作空间的模型’ [2]。这不仅是现有类别中的渐进式改进,更是本地可运行模型类别的质变。Bonsai 27B 支持开启推理模式、多模态输入(文本和视觉)、26.2 万 token 的上下文窗口(通过 4 比特 KV 缓存将原始 17.2 GB 压缩至 4.3 GB),以及支持 speculative decoding,在 CUDA 上实现无损 1.37 倍解码加速 [6][5]。该模型通过 MLX 原生运行于苹果设备,通过 CUDA 运行于 NVIDIA GPU,iPhone 17 Pro 用户已可通过 App Store 上的 Locally AI 应用访问。其能耗表现——每消耗 1% 电池可生成 672 个 token——将持续代理任务推向移动设备热管理和电源管理的新压力测试 [6]

90% 性能保留背后隐藏的艰难权衡

头条数据——1 比特版本 89.5% 的性能保留率——听起来很强,但开发者社区指出 PrismML 发布的基准测试中缺少一个关键对照组:与同等文件大小(5-7 GB)的普通 Q4 量化 90 亿参数模型相比如何?社区测试表明,这些 Q4 量化模型在实际任务中往往优于 Bonsai 27B。90% 的保留率是相对于 Bonsai 27B 自身的全精度基线而言,并非与相同存储预算下最佳替代方案的对比 [8]

具体性能下降值得指出:工具调用能力从 80.0 降至 66.0,下降 17.5%,这对代理和函数调用工作流影响显著 [1]。视觉性能低于预期。SQL 推理表现出明显弱点。三进制版本明显比 1 比特版本更聪明,社区测试者建议使用 f16 KV 缓存以避免循环行为。工具链也存在缺口:主流的 llama.cpp 会将权重解包为 8 比特进行矩阵乘法,破坏速度优势——必须使用 PrismML 的定制分支才能实现推理加速 [8]。LM Studio 和 Unsloth 目前不兼容。在 8 GB 显存下,必须完全卸载所有层;部分卸载会导致速度骤降至约每秒 1 个 token。每消耗 1% 电量生成 672 个 token 的效率意味着一次 1000 token 的推理任务将消耗约 1.5% 电量——短查询尚可接受,但在热节流的额外限制下,长时间代理会话可能代价高昂。

开源社区的反应很好地体现了这种张力。在本地 AI 实践者的核心论坛 r/LocalLLaMA 上,关于 Bonsai 27B 的热门帖子集中讨论了缺失的基准对照:同等文件大小的 Q4 量化 90 亿参数模型在实际评估中往往胜出,社区最高票提问实质上是‘为何只与自己比较?’。与此同时,YouTube 上的反馈偏向动手实践的热情,实践者展示模型本地运行,并强调能力层级才是重点,而非尺寸效率比。实验室基准的兴奋与社区实际审查之间的差距本身就是一个值得跟踪的信号,尤其对苹果是否集成的决策而言。

苹果的战略押注:隐私架构 vs. 交易现实

PrismML 披露与苹果关系的时机极为精准。iOS 27 公开测试版——搭载苹果全新 Siri——于 2026 年 7 月 13 日发布。Bonsai 27B 及与苹果谈判的消息紧随其后于 7 月 14 日公布 [3]。苹果的竞争困境定义清晰:OpenAI 和 Anthropic 的助手依托云端规模运行推理级模型;苹果的隐私优先架构历来迫使它在设备端运行更小、能力更弱的模型。若集成 Bonsai 27B,苹果将能在本地运行 270 亿参数级推理能力——增强 Siri,无需将用户数据发送到设备外,也避免了云端推理的延迟和成本。正如分析师 Carolina Milanesi 所言:‘你能做的越多在设备上,就越好’ [7]

但交易现实远比头条新闻柔和。Hassibi 将谈判描述为‘非常早期’,称苹果‘正在评估我们的技术’——开发者社区对此持怀疑态度,指出一封邮件往来或一次简短技术演示即可称为‘评估技术’ [4]。苹果可能内部开发竞争性压缩技术,与其他供应商合作,或干脆等待开源生态收敛出类似解决方案。还存在结构性矛盾:Bonsai 27B 目前采用 Apache 2.0 许可,社区已表达担忧,若苹果收购或独家授权,可能将该技术闭源。分析师 Tarun Pathak 的观点同样适用——最终考验是数百万次查询在数千种设备组合上的生产级验证,而 Bonsai 27B 尚未经历这一考验 [7]

历史背景

DeepSeek 发布了成本极低的高性能 AI 模型,为专家评估范式级效率突破提供了参照点。Tim Carambat 明确称 Bonsai 27B 为‘AI 真正的 DeepSeek 时刻’。
PrismML 以 1625 万美元种子轮融资结束静默期,推出首个 1 比特大语言模型系列(Bonsai 1.7B、4B、8B),基于 Caltech 知识产权构建。Bonsai 27B 是该基础之上的首个旗舰级发布。
苹果发布了搭载久待 Siri 改版的 iOS 27 公开测试版,让 iPhone 用户首次广泛接触公司重塑的助手。这为 PrismML 次日的宣布设定了竞争背景。
PrismML 发布 Bonsai 27B 的同时披露了与苹果的早期谈判,由 CEO Babak Hassibi 向 CNBC 公开证实。这一时机——在 iOS 27 测试版发布一天后——并非偶然。

关键关系图

关键玩家
主题

PrismML Bonsai 27B 将 270 亿参数 AI 带入 iPhone

PR

PrismML

Bonsai 模型系列及底层 1 比特量化感知训练流程的开发者。作为唯一知识产权持有者,PrismML 在任何与苹果的集成或许可交易中掌握主动权。

AP

Apple

评估者和潜在合作伙伴。苹果需要在设备端实现推理级模型规模的 AI,以与云端原生助手竞争,同时维持其隐私优先的品牌形象。集成将重塑 Siri 的智能层级,而无需将用户数据发送至云端。

BA

Babak Hassibi

PrismML 首席执行官兼联合创始人,加州理工学院教授。作为与苹果谈判的公开代言人,其学术信誉为 QAT 背后的科学主张提供了支撑。

AL

Alibaba / Qwen team

提供 Apache 2.0 许可的 Qwen3.6-27B 基础模型,PrismML 对其进行了压缩。阿里巴巴在无正式合作的情况下获得下游曝光。

KH

Khosla Ventures, Cerberus Ventures, Google, Samsung

提供 1625 万美元种子轮投资并赋予信誉的投资者。他们的支持加速了 PrismML 扩大模型发布和谈判企业交易的能力。

事实来源

9 条引用
  1. [1] Bonsai 27B - PrismML Official Announcement
  2. [2] 9to5Mac: PrismML releases Bonsai 27B, claiming first major AI model of its size fit for iPhone
  3. [3] CNBC: Apple in talks with startup PrismML that shrinks AI models to run on an iPhone
  4. [4] AppleInsider: PrismML confirms it is in talks with Apple about AI model shrinking tech
  5. [5] Alpha Signal: PrismML Shrinks Bonsai 27B to 3.9 GB So It Runs on an iPhone
  6. [6] MarkTechPost: PrismML Releases Bonsai 27B - 1-Bit and Ternary Builds of Qwen3.6-27B That Run on Laptops and Phones
  7. [7] MacDailyNews: Privacy-focused Apple in talks with startup to run more powerful AI models directly on devices
  8. [8] ByteIota: Bonsai 27B Runs on iPhone - The On-Device AI Tradeoffs
  9. [9] HPCwire: PrismML Emerges from Stealth with 1-Bit LLM Family

来源文章

Top 5

THE SIGNAL.

Analysts

称 Bonsai 27B 的影响大于近期重大模型发布,将其与 DeepSeek 2025 年的市场颠覆相提并论,视为向边缘 AI 范式转变的信号。他表示:‘其影响远超 Fable、Mythos 或 GPT 5.6——可能超过它们全部的总和。这是 AI 真正的 DeepSeek 时刻。’

Tim Carambat
AnythingLLM 创始人

强调设备端 AI 处理在用户隐私和体验方面更优,验证了苹果对 PrismML 压缩方法的战略兴趣。

Carolina Milanesi
Creative Strategies 分析师

将苹果的核心挑战描述为硬件受限的优化问题——在严格的设备端内存预算内最大化模型大小和智能。这一框架使 Bonsai 27B 与苹果路线图直接相关。

Horace Dediu
Asymco 分析师

警告称,大规模真实世界验证才是关键考验。实验室基准无法捕捉多样化消费硬件在生产环境中的复杂性——必须经过数百万次查询在数千种设备组合上的测试,其主张才可信。

Tarun Pathak
Counterpoint Research 分析师

将设备端智能视为核心架构原则,而不仅仅是一种压缩技巧。他的观点是:本地化、快速且私密的 AI 是下一代部署范式,而 QAT 背后的 Caltech 开发数学理论使其在不崩溃推理能力的前提下成为可能。

Babak Hassibi
PrismML 首席执行官兼创始人 / 加州理工学院教授
The Crowd

Today, we're announcing Bonsai 27B: the first 27B-class model to run on a phone. Bonsai 27B is the new multimodal flagship of the Bonsai family. Based on Qwen3.6 27B, it brings a new capability tier to local AI: multi-step reasoning, structured tool use, long-context workflows, https://t.co/8N0sdU04D2

@@PrismML5397

Huge if true! We are talking about a 27B multimodal model that runs locally on a phone. That's wild! Bonsai 27B reaches up to 163 tok/s in 1-bit and 134 tok/s in Ternary on an NVIDIA GeForce RTX 5090. On an M5 Max, it reaches up to 87 tok/s in 1-bit and 58 tok/s in Ternary.

@@omarsar069

PrismML releases Bonsai 27B, claiming first major AI model of its size fit for iPhone https://t.co/EML5s1SBdF by @apollozac

@@9to5mac27

Bonsai 27B: 1-bit dense LLM running locally in your browser using custom WebGPU kernels

@u/xenovatech548
Broadcast
I Just Tried The Brand New Ternary Model And It's Great!

I Just Tried The Brand New Ternary Model And It's Great!

54GB to 3.9GB?! 1-Bit Models Just Changed Local AI | Kimi K3 Could Drop Tomorrow

54GB to 3.9GB?! 1-Bit Models Just Changed Local AI | Kimi K3 Could Drop Tomorrow

1-Bit Model, 90% Quality. This Shouldn't Work. It Does.

1-Bit Model, 90% Quality. This Shouldn't Work. It Does.