📖 项目简介
AirLLM 是一个革命性的推理引擎,它大幅降低了大语言模型的推理内存需求。核心理念是无需量化、蒸馏或剪枝,就可以在消费级硬件上运行前沿大模型。它采用分层流式加载技术,按需从磁盘加载模型参数,实现了”用多少加载多少”的推理模式。
💡 核心突破
让 70B 模型在单卡 4GB GPU 上运行,405B Llama 3.1 在 8GB 显存即可运行,
DeepSeek-V3 (671B) 在 ~12GB 显存运行,Kimi K3 (2.8T) 在 3.72GB 显存运行!
📊 项目数据统计
🚀 里程碑发布
🔥 v3.1.0 (2026/07)
Kimi K3 (2.8T) 支持,3.72GB VRAM 运行史上最大开源模型
⭐ v3.0 (2026/06)
FP8 原生支持,DeepSeek-V3 (671B) 在 ~12GB 运行
📦 v2.11 (2024/08)
Qwen2.5 支持,8bit/4bit 量化加速 3 倍
🎉 v1.0 (2023/11)
初始版本,单卡 4GB 运行 70B 模型
🎯 支持模型
⚡ 快速开始
1️⃣ 安装
pip install airllm
# 运行 Kimi K3 需要额外依赖
pip install airllm compressed-tensors flash-attn
2️⃣ 基本推理
# 一行代码运行大模型
model = AutoModel.from_pretrained(“Qwen/Qwen3-32B”)
# 也可以运行更大的模型
model = AutoModel.from_pretrained(“deepseek-ai/DeepSeek-V3”) # 671B
model = AutoModel.from_pretrained(“THUDM/Kimi-K3-Instruct”) # 2.8T
3️⃣ 生成文本
input_text = [‘What is the capital of United States?’]
input_tokens = model.tokenizer(input_text,
return_tensors=“pt”,
return_attention_mask=False,
truncation=True,
max_length=MAX_LENGTH,
padding=False)
generation_output = model.generate(
input_tokens[‘input_ids’].cuda(),
max_new_tokens=20,
use_cache=True,
return_dict_in_generate=True)
output = model.tokenizer.decode(generation_output.sequences[0])
print(output)
4️⃣ 量化加速(可选)
model = AutoModel.from_pretrained(“garage-bAInd/Platypus2-70B-instruct”,
compression=‘4bit’ # 或 ‘8bit’
)
🔧 核心配置
🎨 技术架构
📊 AirLLM 工作流程
→
🔀 分层拆分
→
⚡ 预取加载
→
📤 Token 输出
📈 性能优化
95%
+10%
3x
100%
🖥️ 多平台支持
- Linux/Windows – CUDA GPU 加速推理
- macOS – Apple Silicon 原生支持(需要 mlx)
- Colab – 云端免费 GPU 运行
- CPU – 无 GPU 环境也可运行(较慢)
⚠️ 注意事项
⚠️ 重要提醒
- 首次推理需要将模型分解保存为分层格式,确保 HuggingFace 缓存目录有足够磁盘空间
- 运行 Kimi K3 需要 CUDA 12 和 transformers 4.56.x
- Flash Attention 对 Kimi K3 是必需的
- 建议配备 SSD 以获得最佳磁盘读取性能
🌟 相关资源
- GitHub 仓库 – 30K+ Stars
- Colab 示例
- Llama 3.1 405B 教程
📅 本文数据截至 2026 年 8 月 9 日
持续更新中,欢迎 Star 关注!
