AI工具评测:AirLLM — 4GB显卡跑70B大模型的开源黑科技

一句话总结

AirLLM 是一个免费开源的大模型推理工具,通过"一次只加载一层到显存"的分层流式技术,让你用 4GB 显卡跑 70B 模型、12GB 跑 DeepSeek-V3(671B)、甚至 3.72GB 跑 2.8T 参数的 Kimi K3——不需要量化、蒸馏或剪枝。代价是速度:生成速度以"秒/token"计,适合离线批处理而非实时对话。

核心能力

工作原理

传统推理需要把整个模型塞进显存,而 AirLLM 每次只把一层加载到 GPU,算完就换下一层。所以显存需求取决于"单层大小"而非"模型总大小",MoE 模型更是只加载 token 实际路由到的专家。这就是为什么 2.8T 的 Kimi K3 反而只需要 3.72GB 显存。

显存需求实测(官方数据)

模型 参数量 所需显存
Qwen3 / Mistral / Phi ~8B ~1–2 GB
Qwen3-30B / Mixtral 30–47B ~1–3 GB
Llama 3.x 70B(全精度) 70B ~4 GB
Qwen3-235B(MoE) 235B ~3 GB
Llama 3.1 405B 405B ~8 GB
DeepSeek-V3 671B ~12 GB
Kimi K3(当前最大开源模型) 2.8T ~3.72 GB

价格

完全免费。Apache-2.0 开源协议,pip install airllm 即装即用。开发者靠 GitHub Sponsors / Patreon 支持,无任何付费墙或云服务绑定。

功能列表

  • 一行代码推理AutoModel.from_pretrained("模型名") 即可运行,兼容 Hugging Face 全系模型(Llama、Qwen、DeepSeek、Mistral、Phi、Gemma、ChatGLM、Baichuan、InternLM、Yi 等)
  • FP8 支持:v3.0 起原生支持 FP8 量化权重,DeepSeek-V3 和 Qwen3-FP8 直接加载
  • 块级量化压缩:可选 4bit/8bit 压缩,推理提速最高 3 倍,精度损失几乎可忽略
  • 预取(Prefetching):加载与计算重叠,默认开启
  • CPU 推理 & macOS 支持:Apple Silicon(通过 MLX)也能跑 70B 模型
  • 自动模型识别:AutoModel 自动检测模型类型,无需手动指定类

适用场景

  • 离线批处理:QA 批量校验、代码重构、文档处理,夜间挂着跑
  • 敏感数据本地推理:数据不能出域的 SaaS 场景(金融、医疗、企业内部)
  • 低配硬件尝鲜:没有 24GB+ 大显存,但想体验顶级开源模型
  • 教学与研究:理解 MoE 路由、层流式推理机制

优缺点

优点

  1. 显存需求碾压级 — 别人要 8 张 H100 的模型,它 12GB 就能跑,硬件门槛降到消费级
  2. 完全免费 — Apache-2.0 开源,无订阅、无 API 费,只花电费
  3. 不牺牲模型精度 — 不做量化也能跑全精度模型,MoE 模型效果不打折
  4. 新模型支持快 — 主流开源模型发布当天基本就能跑(Kimi K3 发布后即支持)
  5. 上手简单 — pip 安装 + 一行代码,Hugging Face 生态无缝衔接
  6. 本周热度高 — 2026-08-03 登顶 Hacker News(230+ 分),社区关注度极高

缺点

  1. 速度是硬伤 — Kimi K3 实测 292 秒/token(约 5 分钟一个字),70B 模型也是"秒/token"级别,交互式对话基本不可用
  2. 磁盘开销大 — 模型需要按层分解保存,占用磁盘空间大,且推理时持续读盘
  3. 文档偏弱 — 被用户吐槽"文档不像文档",主要靠 README 和示例 notebook,排查问题要靠社区
  4. GPU 利用率低 — 频繁加载/卸载层,实测功耗利用仅约 30%,单位 token 能耗不低
  5. 无 API 服务形态 — 只提供 Python 库,没有开箱即用的服务端/Ollama 式封装,需要自己写集成代码
  6. 实用性存疑 — 多位 HN 用户直言"技术上惊人,但当前速度下功能用途有限"

与竞品对比

维度 AirLLM llama.cpp Ollama vLLM
价格 免费(开源) 免费(开源) 免费(开源) 免费(开源)
70B 模型最低显存 ~4GB ~40GB(Q4量化) ~40GB(Q4量化) 需多卡部署
推理速度 秒/token(慢) 快(token/秒) 快(token/秒) 极快(生产级)
模型精度 全精度/原生 依赖量化等级 依赖量化等级 依赖量化等级
易用性 中(需写代码) 极高(一键运行) 低(面向服务器)
CPU 支持 ✅(含 Apple Silicon)
定位 低显存跑超大模型 高效本地推理 用户友好本地推理 高吞吐生产推理

一句话对比:llama.cpp / Ollama 是"速度与易用的标杆",但显存门槛高;AirLLM 是唯一能把 671B 模型塞进 12GB 显存的方案,用速度换显存。两者不是替代关系,而是互补——硬件够用选前者,硬件不够才轮到 AirLLM。

适合谁用

✅ 推荐给:
- 数据敏感场景的开发者 — 数据不能出域,又需要强模型能力,AirLLM 是本地化的唯一现实路径(有 HN 用户正用它做 SaaS 离线批处理)
- 只有低配显卡的爱好者 — 4GB 老显卡、8GB MacBook 用户,想体验 70B+ 级开源模型
- 离线批处理需求者 — QA、重构、批量翻译等不要求实时的任务,夜间跑完第二天收结果
- 想研究 MoE / 推理机制的学生 — 源码清晰展示了层流式与专家路由原理

❌ 不推荐给:
- 需要实时对话/编程助手的人 — 每秒几个 token 的速度会让你怀疑人生,直接用云端 API 或 Ollama 跑小模型
- 追求开箱即用的用户 — 没有图形界面和一键安装,需要 Python 基础
- 生产级高并发服务 — 这是 vLLM 的领域,不是 AirLLM 的

评分(满分5)

  • 功能:⭐⭐⭐⭐(能跑任何开源模型的"可能性"满分,但速度限制实用性)
  • 性价比:⭐⭐⭐⭐⭐(免费 + 低硬件门槛,成本几乎为零)
  • 易用性:⭐⭐⭐(pip 一行代码入门,但文档和排错体验一般)
  • 整体推荐:⭐⭐⭐⭐(特定场景下无可替代,但别指望它替代 Ollama)

一句话建议:如果你的痛点恰好是"显存不够跑大模型、数据又不能出域",AirLLM 是免费且唯一的选择;如果你只是想本地聊天写代码,它还不是你要找的工具——先看看 Ollama 和 llama.cpp。动手前记住:它测的是"秒/token",不是"token/秒"。