🐦
Colibri
让普通硬件也能运行千亿参数大模型
⚡ 纯 C 零依赖
🚀 744B MoE
💾 分层内存
🔬 开放研究
🚀 744B MoE
💾 分层内存
🔬 开放研究
💡 一句话概括:Colibri 是革命性的推理引擎,用极小的引擎运行惊人的模型——就像蜂鸟虽小,却能完成壮举。
🌟 项目背景
你是否曾想过,在自己普通的电脑上运行一个拥有 7440 亿参数的巨型 AI 模型?听起来像天方夜谭对吧?毕竟,通常这类模型都需要昂贵的数据中心级硬件才能运行。
但 MoE(Mixture-of-Experts)模型的出现改变了这一切。
📊 支持的大模型
| 模型 | 总参数 | 激活参数 | 磁盘需求 | 内存需求 |
|---|---|---|---|---|
| OLMoE | 7B | 1B | ~4 GB | 8 GB |
| GLM-5.2 ⭐ | 744B | 40B | ~372 GB | 16-24 GB |
| Inkling | 975B | 41B | ~469 GB | 25-120 GB |
| Kimi K3 | 2.8T | 104B | ~1.6 TB | 32+ GB |
| DeepSeek V4 | 284B | 13B | ~167 GB | 16-22 GB |
🎯 关键发现:这些巨型模型不需要 GPU!只需一个足够快的硬盘。
🧠 工作原理:JIT for Weights
Colibri 的核心思想很简单——参数不是需要完整驻留的状态,而是按需调度的数据。
📐 三层内存层级
⚡
VRAM (GPU 显存)
最快,但容量有限 | 常驻专家
💾
RAM (系统内存)
中等速度 | 密集部分 + 缓存专家
💿
NVMe (硬盘)
最慢,但容量巨大 | 所有专家流式传输
📈 研究数据:路由决策有 71.6% 的可预测性
✨ 核心特性
1️⃣ 纯粹的 C 实现
Colibri 只有一个 C 文件(c/glm.c),无需任何依赖:
运行效果:
$ ./coli chat
🐦 colibri v1.4.0 — GLM-5.2 · 744B MoE · int4
✓ ready in 32s · resident 9.9 GB
2️⃣ 双 SSD 加速
📊 性能提升:双 SSD 组合比单盘快 33%
3️⃣ 学习型缓存
🔥 Colibri 用越多,越快!
4️⃣ 可视化仪表盘
📈
仪表盘
🧠
大脑
🌌
星图
📊 实测性能
| 硬件配置 | 模型 | 速度 |
|---|---|---|
| 🚀 6× RTX 5090 | GLM-5.2 | 5.8-6.8 tok/s |
| 💻 128 GB CPU | GLM-5.2 | ~1.8 tok/s |
| 🔌 RTX 5070 Ti | GLM-5.2 | 1.07 tok/s |
| 📦 25 GB 开发机 | GLM-5.2 | 0.05-0.1 tok/s |
🚀 快速开始
# 安装 git clone https://github.com/JustVugg/colibri && cd colibri/c ./setup.sh # 运行 COLI_MODEL=/nvme/glm52_i4 ./coli chat ./coli web --model /nvme/glm52_i4
💭 个人思考
🏠
去中心化推理
🔬
可测量性
📖
透明性
🤝
社区驱动
这个项目让我想起了开源精神的本质——让技术民主化,让每个人都能访问前沿 AI。
📚 相关链接
🐦
Tiny engine, immense model.
微小的引擎,巨大的模型。
