欢迎光临
我们一直在努力

colibrì : 1300 行 C 代码,25GB 笔记本,跑起 7440 亿参数大模型, 用纯 C 和 Claude 做了件所有人说不可能的事 | SSP Github Daily

每日开源 · 第 091 期 · 2026-07-12 早间篇

1300 行 C 代码,25GB 笔记本,跑起 7440 亿参数大模型

一个意大利开发者用纯 C 和 Claude 做了件所有人说不可能的事

**免责声明:**本工具依赖境外公开数据源(Hugging Face 模型权重、GitHub 开源代码),部分平台在中国大陆需合规网络环境访问。本文仅作技术研究分享,不构成任何投资或使用建议。

一、开篇

2026 年 7 月 6 日,GitHub 上出现了一个叫 colibrì 的项目。名字来自意大利语的\”蜂鸟\”——一种体重不过几克、每天访问上千朵花的小鸟。

它的作者叫 JustVugg,一个之前几乎没有公开项目记录的开发者。他用 10 天时间、约 1300 行纯 C 代码,在一台 12 核 CPU + 25GB 内存的普通笔记本上,成功运行了智谱 GLM-5.2——一个 744B 参数的 MoE 旗舰模型。

没有 GPU,没有 BLAS,没有 Python 运行时。零外部依赖。整个推理引擎就一个文件:glm.c。

他最诚实的一句话写在 README 里:“This is not fast.” 冷启动只有 0.05 tok/s。你发一句话,它回一个字,你去倒杯咖啡回来,它正在回第二个字。

但它确实跑起来了。不是 demo,不是 mock。是完整的 744B 参数推理,输出和官方模型 逐 token 对齐验证,32/32 完全通过。

一个在 25GB 笔记本上正确回答问题的 744B 前沿模型——2026 年 7 月 6 日之前,没有人做到过。

二、项目速览

项目名:colibrì

GitHub:JustVugg/colibri

Stars:2.8k+ 🔥 本周 Trending

语言:纯 C(运行时),Python(仅转换工具)

协议:Apache 2.0(模型权重 MIT)

模型:GLM-5.2(744B MoE),支持 OLMoE

最低硬件:16GB RAM + 370GB NVMe + AVX2 CPU

关键成就:25GB 笔记本跑 744B 模型,逐 token 验证通过

三、它能解决什么问题?

当下的 AI 基础设施叙事很简单:**大模型 = 大 GPU = 大钱。**跑一个 744B 参数的 GLM-5.2,正常需要一机房 H100 显卡——每张售价 3 万美金,光散热风扇就得配好几个。对于普通开发者来说,百亿甚至千亿级的前沿模型,永远是 API 那头的东西。

colibrì 在挑战这个预设。

它的核心洞察出奇简单:**MoE 模型虽然大,但每次推理只用一小部分。**GLM-5.2 有 744B 总参数,可每个 token 实际激活的只有约 40B——其中 17B 是 attention 和共享专家(每次都用),真正随 token 变化的路由专家只有约 11GB。

那你为什么不把这 11GB 按需从 NVMe 固态硬盘读出来,而不是强行把全部 370GB 权重都塞进显存?

colibrì 的解法:

**1****Dense 部分常驻内存:**attention 层、共享专家、embedding(约 17B 参数),int4 量化后仅占 9.9GB

**2****路由专家躺磁盘:**21,504 个路由专家(75 层 × 256 experts + MTP head),约 370GB,按

赞(0)
未经允许不得转载:171主机测评 » colibrì : 1300 行 C 代码,25GB 笔记本,跑起 7440 亿参数大模型, 用纯 C 和 Claude 做了件所有人说不可能的事 | SSP Github Daily
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址