Back to News

UC Berkeley, MIT et al. Open-Source FreeToken Edge Inference Runs Full MoE Models on Single Consumer GPU

#freetoken#moe#edge-inference#consumer-gpu

UC Berkeley, MIT, and other institutions have open-sourced FreeToken, an edge-native inference system for MoE large language models, enabling full-weight models to run on a single consumer GPU. Reported benchmarks show a laptop RTX 4060 running Qwen3.6-35B at 39.3 tokens/s, exceeding the median decode speed of Codex production traces, and a desktop RTX 5090 running DeepSeek-V4-Flash 284B. The system uses bandwidth-adaptive execution to overcome PCIe bottlenecks common in traditional offloading approaches.

Coverage timeline

  1. 机器之心机器之心

    编辑 | 泽南 「这个结果太疯狂了。」 本周五,AI 社区热烈讨论的是一个端侧大模型部署技术,它能让笔记本 RTX 4060 跑 Qwen 3.6-35B,桌面 RTX 5090 跑得起 DeepSeek-V4-Flash 284B。而且都是单卡,模型都是满血的。 Codex 生产 trace 的中位 decode 速度是 33 token/s,笔记本 RTX 4060 跑 Qwen3.6-35B 的 39.3 token/s 已经超过了这个数。 来自 UC Berkeley、MIT 等机构的联合团队开源了名为 FreeToken 的全新开源边缘端推理系统。并列一作杨硕(Shuo Yang)是伯克利 EECS 博士生,范晓泽(Xiaoze Fan)在 UT Austin,两人本科均毕业于上海交通大学。FreeToken 的作者还包括 Ion Stoica、Matei Zaharia、Kurt Keutzer、韩松等顶尖学者。 该系统专门针对 MoE(混合专家)大模型在消费级硬件上的本地部署进行了全栈协同设计,打破了大规模前沿模型必须依赖数据中心集群的硬件门槛。 论文:《FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution》 论文链接:https://arxiv.org/abs/2608.16157 GitHub:https://github.com/FlashML-org/FreeToken 官网:https://www.flashml.ai/ FreeToken 现在已经提供了 Windows / Linux 桌面 App(带 GUI),CLI 一行 uv pip install "freetoken [accel]" 即可载入。 消费级硬件能跑什么? 传统的 CPU-GPU 权重卸载(Offloading)方案往往因为 PCIe 带宽瓶颈导致推理速度极慢(每秒几 token 甚至卡顿),而 FreeToken 实现了「交互级实用速度」的本地推理。 除了每秒 Token 速度,在处理长 Prompt(如 4-16k 上下文)时,传统 Offloading 方案因逐层从系统内存拉取 Expert 导致严重 I/O 阻塞。 FreeToken 将首 Token 延迟