在没有顶级 GPU 的情况下,普通笔记本能跑 744B(7440亿参数)的 GLM-5.2 大模型吗?答案不仅是“能”,甚至连 2.8T 参数的 Kimi K3 也能在 32GB 内存上运行。最近在 GitHub 上狂揽 32k Star 的开源项目 Colibrì 彻底火了。这是一个纯 C 语言实现、零推理引擎依赖的分层推理框架,专门为在低配消费级硬件上运行超大规模模型而设计。
Colibrì 能够实现这一壮举,核心得益于如今大模型主流的 MoE(混合专家模型) 架构。以 GLM-5.2 为例,虽然总参数量高达 744B,但在生成每个 Token 时,实际上只有大约 40B 的参数被激活。Colibrì 的思路非常粗暴且有效:既然绝大多数专家在当前步骤用不上,为什么要把它们全部塞进昂贵的内存或显存里?
因此,Colibrì 将模型权重拆分为两部分。Attention、Embedding 等基础 Dense 模块(约 17B 参数,在 int4 量化后仅占 9.9GB)常驻系统 RAM。而占大头的 19456 个路由专家(约 370GB)则直接存放在 NVMe SSD 中。当 Router 选定当前计算所需的专家时,系统再动态地从 SSD 中读取并加载。开发者 JustVugg 将这种机制类比为权重层面的 JIT(即时编译),实现了数据在 SSD、RAM 和 VRAM 之间的动态调度。
为了解决 SSD 读取带来的延迟问题(最开始冷启动只有约 0.05-0.1 token/s),Colibrì 引入了精妙的分层内存管理。它采用了 LRU(最近最少使用)缓存 机制,将高频使用的专家留在高速缓存中。更重要的是,项目利用相邻层之间专家路由的强相关性,实现了准确率高达 71.6% 的下一层路由预测。在当前层计算时,后台已提前预取下一层所需的专家数据,让计算与 SSD I/O 最大程度重叠。
此外,Colibrì 还支持双 SSD 并行读取。通过在两块不同的硬盘上放置模型副本,可以翻倍利用硬件带宽,进一步压榨系统读取极限,大大提升了无显卡环境下的推理速度。
长期以来,构建复杂的端侧 AI Agent 面临着巨大的硬件鸿沟:高表现力的超大参数模型和多智能体协同(Multi-Agent)对显存有着近乎贪婪的需求。Colibrì 的爆火揭示了边缘端 AI 生态的一个重要趋势:大模型推理正在从“显存吞吐受限”向“存储带宽受限”转移。通过将高性能 NVMe SSD 转化为动态路由的“虚拟显存”,#MoE 模型的稀疏激活特性被利用到了极致。这种“按需即时加载(JIT for Weights)”的技术路径,为未来在智能手机、智能家居及智能车载等边缘网关上部署具备深度规划、长文本反思能力的超大参数 Local Agent 铺平了道路。虽然当前的 I/O 延迟仍无法匹配原生显卡,但随着 PCIe 6.0/7.0 通道的普及以及 SSD 顺序读取速度的飙升,边缘端运行万亿级单体 Agent 或 Agent 群落将不再是科幻小说,AI 普惠的门槛正被这些底层工程创新无情地踏平。



