FreeToken:加州大学伯克利分校与麻省理工学院开源的推理引擎可在单个消费级GPU上运行7530亿参数的MoE模型
TECH

FreeToken:加州大学伯克利分校与麻省理工学院开源的推理引擎可在单个消费级GPU上运行7530亿参数的MoE模型

25+
Signals

战略概览

  • 01.
    FreeToken是一款面向边缘设备的专家混合(mixture-of-experts)服务引擎,由加州大学伯克利分校和麻省理工学院的研究人员开源,它将所有模型权重存储在系统内存中,仅将GPU用作频繁调用专家模块的缓存。
  • 02.
    这使得远超GPU显存容量的模型也能在消费级硬件上以交互速度运行:在8GB显存的笔记本GPU上运行350亿参数模型,在游戏台式机GPU上运行2840亿参数模型,以及在单个工作站GPU上运行7530亿参数的GLM-5.2模型。
  • 03.
    该软件采用Apache 2.0许可证开源,通过PyPI(freetoken v0.1.2)、GitHub上的FlashML-org组织发布,并提供适用于Windows和Linux系统的桌面GUI应用,下载地址为flashml.ai。
  • 04.
    在RTX PRO 6000上,FreeToken以每秒14.9个token的速度运行7530亿参数的GLM-5.2模型,相比之下,llama.cpp在同一硬件上的速度为每秒7.3个token。

实际工作原理:内存是模型的家,GPU只是缓存

FreeToken颠覆了传统假设——即模型必须完全装入GPU内存。它将所有权重保留在系统RAM中,而将GPU视为全局LRU缓存,仅保存当前token所路由经过的“热点”专家模块[2]。由于MoE模型每个token只激活一小部分专家模块,因此在一次前向传播过程中,7530亿参数模型的大部分根本无需加载到GPU上,这正是实现数百亿乃至千亿级参数模型在8–96GB显存卡上推理的核心技巧。

更难的工程问题是隐藏专家模块进出缓存所带来的延迟。FreeToken在首次运行时对PCIe和CPU内存带宽进行一次基准测试,然后根据特定机器的实际性能动态分配缓存未命中任务——在PCIe传输路径和CPU侧执行之间按实际更快的一方比例拆分[3]。预填充(prefill)和解码(decode)被视为两个独立的带宽问题:预填充使用全层双缓冲流式处理来重叠权重加载与计算过程,而解码则依赖自适应LRU缓存;此外,VRAM可在专家缓存和KV缓存之间于运行时重新分配,无需重启引擎。正如一段对该代码库的技术解析所指出的那样,真正的瓶颈从来不是原始算力,而是专家权重何时、何地移动。

标题背后的真相:基准测试背后的故事

围绕FreeToken发布的每一篇媒体报道和社交媒体内容都在讲述同一个简洁的故事:比Ollama快2–4倍,在单张显卡上运行7530亿参数模型的速度几乎是llama.cpp的两倍。这一叙事几乎完全来自论文自身的基准表格及研究人员自己的社交发文。最详尽的独立审查出现在Reddit的r/LocalLLaMA论坛中,最初是一篇热情的实测报告,后来演变为一场尖锐的方法论争论。

核心质疑点包括:未披露llama.cpp基线版本提交记录或运行标志、未说明显著影响llama.cpp卸载性能的调优选项、仅提供单次运行数据且无波动范围报告、以及未能明确承认此前llama.cpp在卸载方面的先驱工作。最尖锐的指控——FreeToken项目自身的GitHub拉取请求显示,其基于带宽的混合执行启发式策略在某些配置下表现不如纯CPU执行——恰恰源自该项目内部仓库,而非外部评测。一项独立复现确实发现了在相同硬件条件下比llama.cpp快2.2–3.1倍的解码速度提升,但冷启动首token延迟显著更长(21.7秒对比4.7秒),这种权衡在headline数字中并未提及。

为何此时出现:前沿模型参数规模正超越消费级硬件能力

论文自身的论述很直接:开源权重的前沿模型不断发布,但服务于它们的基础设施仍默认处于数据中心环境[1]。随着MoE模型的总参数量突破任何单个消费级GPU所能容纳的极限,而每个token所需激活的专家数量却保持较小,这一鸿沟正在扩大。

传统的CPU-GPU卸载技术早已存在,但它始终受限于PCIe带宽,因为它假设互联通道是唯一关键变量[1]。FreeToken的贡献在于测量给定机器的实际可用带宽——无论是PCIe还是主机内存,并据此调整执行路径的分配比例——这个看似微小的想法,当决定因素是从可响应聊天机器人到卡顿界面之间的几秒延迟时,变得至关重要。

细节点明:DDR5、仅支持CUDA,以及你仍需的大量内存

8GB显存的headline掩盖了一个真实成本:运行最大支持配置仍需约512GB系统内存,因为现在这些内存承担了原本由GPU完成的工作[4]。FreeToken所描绘的分级硬件图景——8GB笔记本GPU支持350亿参数、32GB桌面显卡支持2840亿参数、96GB工作站显卡支持7530亿参数——只有在对应主机具备足够系统内存的情况下才成立[5]

社区测试揭示了公告未强调的多个粗糙之处:目前引擎仅支持CUDA,尚无Vulkan路径,对AMD显卡或Apple Silicon的支持不确定,最佳性能绑定于官方NVFP4量化检查点,而非大多数本地大模型用户磁盘上已有的GGUF或EXL3格式。测试者还总结出一条与GPU无关的实用建议:DDR5内存速度(不仅仅是容量)对实际吞吐量有不成比例的影响,因为每次缓存未命中都需往返系统内存,而非停留在显卡上。

历史背景

FreeToken作为开源项目正式发布。
MarkTechPost发表题为《认识FreeToken:一款可在单个工作站GPU上运行7530亿参数GLM-5.2的边缘原生MoE服务引擎》的报道。
Dataconomy发布文章确认FreeToken使7530亿参数模型在单个工作站GPU上实现推理成为可能。

关键关系图

关键玩家
主题

FreeToken:加州大学伯克利分校与麻省理工学院开源的推理引擎可在单个消费级GPU上运行7530亿参数的MoE模型

UC

UC Berkeley (EECS, incl. Kurt Keutzer, Ion Stoica, Matei Zaharia)

Lead academic institution behind FreeToken; several co-authors, including Shuo Yang, Kurt Keutzer, Ion Stoica, and Matei Zaharia, are Berkeley-affiliated researchers and professors who shaped the system's design and paper.

MI

MIT (Song Han)

Co-author Song Han, an MIT professor known for efficient machine learning systems research, contributes to FreeToken's design.

UT

UT Austin (Chenfeng Xu, Xiaoze Fan)

Additional collaborating institution; co-authors Chenfeng Xu and Xiaoze Fan are UT Austin-affiliated and contributed to the system and paper.

FL

FlashML-org

GitHub organization that maintains the FreeToken open-source repository and ships the flashml.ai desktop app.

事实来源

5 条引用
  1. [1] FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution
  2. [2] FlashML-org/FreeToken
  3. [3] Meet FreeToken: An Edge-Native MoE Serving Engine that Runs 753B GLM-5.2 on a Single Workstation GPU
  4. [4] FreeToken 753B Local MoE: Single GPU Hardware Guide
  5. [5] FreeToken Brings Massive AI Models to a Single GPU

来源文章

Top 5

THE SIGNAL.

Analysts

强调FreeToken跨GPU层级的基准结果表明本地AI推理正变得切实可行。

Yuchen Jin
X/Twitter用户(@Yuchenj_UW)

将FreeToken在不同GPU层级的表现总结为本地MoE推理领域对Ollama的一项显著飞跃。

Akshay
X/Twitter用户(@akshay_pachaar)
The Crowd

UC Berkeley just open-sourced FreeToken. (2–4x faster local LLM inference than Ollama) the results are wild: - Qwen3.6-35B on an 8GB GPU at 39.3 tokens/s - DeepSeek-V4-Flash 284B on a 32GB GPU at 22 tokens/s - GLM-5.2 753B on a 96GB GPU at 14.9 tokens/s a 35B model at 16-bit

@@akshay_pachaar2932

FreeToken is fast. Comparing to Ollama, we have 3–4× faster decode, and 6–30× faster prefill How? We introduce bandwidth-adaptive CPU–GPU execution + semantic-aware caching across agent turns. More details in the technical report: arxiv.org/abs/2608.16157

@@Andy_ShuoYang2536

A 20GB model doesn't fit in this RTX 5080's 16GB VRAM. It still runs at ~100 tok/s. NEW INFERENCE ENGINE! FreeToken is a new open-source inference engine designed specifically to run huge MoE models on hardware that doesn't have enough VRAM to hold them. ... and there

@@TeksEdge1122

Freetokens project is impressive

@u/ViRROOO47
Broadcast
FreeToken Is INSANE — Run Giant AI Models Locally

FreeToken Is INSANE — Run Giant AI Models Locally

FreeToken: Run Giant MoE LLMs on Local Hardware

FreeToken: Run Giant MoE LLMs on Local Hardware

FreeToken: Running Trillion-Parameter AI on Your Gaming GPU

FreeToken: Running Trillion-Parameter AI on Your Gaming GPU