Colibrì: C-based inference framework runs 744B-param GLM-5.2 on laptops via SSD offloading, no GPU needed
Colibrì, an open-source C-based hierarchical inference framework, has gained 32k GitHub stars for enabling large MoE models to run on laptops with limited RAM by offloading inactive experts to SSD, without requiring a GPU. It supports models from GLM-5.2/5.3, DeepSeek V4 Flash, Qwen, to 975B Inkling and 2.8T Kimi K3, with RAM requirements as low as 16GB for int4-processed GLM-5.2.
Coverage timeline
量子位量子位
笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub 田, 晏林 2026-09-26 17:01:00 来源: 量子位 GitHub现在最火热的大模型开源小蜂鸟Colibrì是个啥? 闻乐 发自 凹非寺 量子位 | 公众号 QbitAI 25GB笔记本硬跑744B GLM-5.2,32GB内存挑战2.8T Kimi K3—— 甚至都不用GPU 。 GitHub现在最火热的大模型开源小蜂鸟 Colibrì ,纯C实现、零引擎依赖的分层推理框架,已经狂揽 32k Star 。 它最早是冲着GLM-5.2来的。 正常情况下,744B的总参数规模已经让普通消费级电脑望而却步,但Colibrì的办法可以说是相当简单粗暴: 内存装不下,那就别全装进去。 模型里暂时用不到的部分,直接扔在SSD里;等推理真的需要哪个专家,再现场从硬盘把它捞出来。 于是,GLM-5.2经过int4处理后大约372GB的权重,可以在最低16GB、推荐24GB左右RAM的机器上运行,GPU甚至不是必需品。 作者最初验证它的开发机,也只有 12核CPU+25GB RAM 。 现在,Colibrì已经不满足于744B了。 它目前已经覆盖9个模型家族, 从GLM-5.2/5.3、DeepSeek V4 Flash、Qwen,一路支持到了975B的Inkling,以及2.8T参数的Kimi K3 。 虽然后者需要大约1.6TB硬盘空间,但RAM要求只要32GB起步。 744B模型,内存里只放9.9GB Colibrì能这么玩,首先得感谢这两年越来越流行的 MoE架构 。 以GLM-5.2为例。虽然整个模型足足有744B参数,但MoE并不会在生成每个token时把744B参数全部计算一遍。 它会先通过Router判断:这个token该交给哪些“专家”处理?然后只激活其中一小部分。 GLM-5.2总参数744B,但每个token实际激活的参数大约只有40B,这就留下了一个很大的操作空间: 既然绝大多数专家当前根本用不上,为什么非得把它们一直放在昂贵的高速内存里? 于是Colibrì干脆把模型拆成了 常驻 和 临时调用 两部分。 Attention、Embedding、共享专家这些每次推理都要用到的Dense部分,大约17B参数,int4之后只占约9.9GB,直接常驻RAM。 真正占地方的是
