一句话总结
AirLLM 是一个免费开源的大模型推理工具,通过"一次只加载一层到显存"的分层流式技术,让你用 4GB 显卡跑 70B 模型、12GB 跑 DeepSeek-V3(671B)、甚至 3.72GB 跑 2.8T 参数的 Kimi K3——不需要量化、蒸馏或剪枝。代价是速度:生成速度以"秒/token"计,适合离线批处理而非实时对话。
核心能力
工作原理
传统推理需要把整个模型塞进显存,而 AirLLM 每次只把一层加载到 GPU,算完就换下一层。所以显存需求取决于"单层大小"而非"模型总大小",MoE 模型更是只加载 token 实际路由到的专家。这就是为什么 2.8T 的 Kimi K3 反而只需要 3.72GB 显存。
显存需求实测(官方数据)
| 模型 | 参数量 | 所需显存 |
|---|---|---|
| Qwen3 / Mistral / Phi | ~8B | ~1–2 GB |
| Qwen3-30B / Mixtral | 30–47B | ~1–3 GB |
| Llama 3.x 70B(全精度) | 70B | ~4 GB |
| Qwen3-235B(MoE) | 235B | ~3 GB |
| Llama 3.1 405B | 405B | ~8 GB |
| DeepSeek-V3 | 671B | ~12 GB |
| Kimi K3(当前最大开源模型) | 2.8T | ~3.72 GB |
价格
完全免费。Apache-2.0 开源协议,pip install airllm 即装即用。开发者靠 GitHub Sponsors / Patreon 支持,无任何付费墙或云服务绑定。
功能列表
- 一行代码推理:
AutoModel.from_pretrained("模型名")即可运行,兼容 Hugging Face 全系模型(Llama、Qwen、DeepSeek、Mistral、Phi、Gemma、ChatGLM、Baichuan、InternLM、Yi 等) - FP8 支持:v3.0 起原生支持 FP8 量化权重,DeepSeek-V3 和 Qwen3-FP8 直接加载
- 块级量化压缩:可选 4bit/8bit 压缩,推理提速最高 3 倍,精度损失几乎可忽略
- 预取(Prefetching):加载与计算重叠,默认开启
- CPU 推理 & macOS 支持:Apple Silicon(通过 MLX)也能跑 70B 模型
- 自动模型识别:AutoModel 自动检测模型类型,无需手动指定类
适用场景
- 离线批处理:QA 批量校验、代码重构、文档处理,夜间挂着跑
- 敏感数据本地推理:数据不能出域的 SaaS 场景(金融、医疗、企业内部)
- 低配硬件尝鲜:没有 24GB+ 大显存,但想体验顶级开源模型
- 教学与研究:理解 MoE 路由、层流式推理机制
优缺点
优点
- 显存需求碾压级 — 别人要 8 张 H100 的模型,它 12GB 就能跑,硬件门槛降到消费级
- 完全免费 — Apache-2.0 开源,无订阅、无 API 费,只花电费
- 不牺牲模型精度 — 不做量化也能跑全精度模型,MoE 模型效果不打折
- 新模型支持快 — 主流开源模型发布当天基本就能跑(Kimi K3 发布后即支持)
- 上手简单 — pip 安装 + 一行代码,Hugging Face 生态无缝衔接
- 本周热度高 — 2026-08-03 登顶 Hacker News(230+ 分),社区关注度极高
缺点
- 速度是硬伤 — Kimi K3 实测 292 秒/token(约 5 分钟一个字),70B 模型也是"秒/token"级别,交互式对话基本不可用
- 磁盘开销大 — 模型需要按层分解保存,占用磁盘空间大,且推理时持续读盘
- 文档偏弱 — 被用户吐槽"文档不像文档",主要靠 README 和示例 notebook,排查问题要靠社区
- GPU 利用率低 — 频繁加载/卸载层,实测功耗利用仅约 30%,单位 token 能耗不低
- 无 API 服务形态 — 只提供 Python 库,没有开箱即用的服务端/Ollama 式封装,需要自己写集成代码
- 实用性存疑 — 多位 HN 用户直言"技术上惊人,但当前速度下功能用途有限"
与竞品对比
| 维度 | AirLLM | llama.cpp | Ollama | vLLM |
|---|---|---|---|---|
| 价格 | 免费(开源) | 免费(开源) | 免费(开源) | 免费(开源) |
| 70B 模型最低显存 | ~4GB ⭐ | ~40GB(Q4量化) | ~40GB(Q4量化) | 需多卡部署 |
| 推理速度 | 秒/token(慢) | 快(token/秒) | 快(token/秒) | 极快(生产级) |
| 模型精度 | 全精度/原生 | 依赖量化等级 | 依赖量化等级 | 依赖量化等级 |
| 易用性 | 中(需写代码) | 中 | 极高(一键运行) | 低(面向服务器) |
| CPU 支持 | ✅(含 Apple Silicon) | ✅ | ✅ | ❌ |
| 定位 | 低显存跑超大模型 | 高效本地推理 | 用户友好本地推理 | 高吞吐生产推理 |
一句话对比:llama.cpp / Ollama 是"速度与易用的标杆",但显存门槛高;AirLLM 是唯一能把 671B 模型塞进 12GB 显存的方案,用速度换显存。两者不是替代关系,而是互补——硬件够用选前者,硬件不够才轮到 AirLLM。
适合谁用
✅ 推荐给:
- 数据敏感场景的开发者 — 数据不能出域,又需要强模型能力,AirLLM 是本地化的唯一现实路径(有 HN 用户正用它做 SaaS 离线批处理)
- 只有低配显卡的爱好者 — 4GB 老显卡、8GB MacBook 用户,想体验 70B+ 级开源模型
- 离线批处理需求者 — QA、重构、批量翻译等不要求实时的任务,夜间跑完第二天收结果
- 想研究 MoE / 推理机制的学生 — 源码清晰展示了层流式与专家路由原理
❌ 不推荐给:
- 需要实时对话/编程助手的人 — 每秒几个 token 的速度会让你怀疑人生,直接用云端 API 或 Ollama 跑小模型
- 追求开箱即用的用户 — 没有图形界面和一键安装,需要 Python 基础
- 生产级高并发服务 — 这是 vLLM 的领域,不是 AirLLM 的
评分(满分5)
- 功能:⭐⭐⭐⭐(能跑任何开源模型的"可能性"满分,但速度限制实用性)
- 性价比:⭐⭐⭐⭐⭐(免费 + 低硬件门槛,成本几乎为零)
- 易用性:⭐⭐⭐(pip 一行代码入门,但文档和排错体验一般)
- 整体推荐:⭐⭐⭐⭐(特定场景下无可替代,但别指望它替代 Ollama)
一句话建议:如果你的痛点恰好是"显存不够跑大模型、数据又不能出域",AirLLM 是免费且唯一的选择;如果你只是想本地聊天写代码,它还不是你要找的工具——先看看 Ollama 和 llama.cpp。动手前记住:它测的是"秒/token",不是"token/秒"。