显存只有 4GB,也能运行 700 亿参数的大语言模型——这是开源推理库 AirLLM 的核心能力。它不压缩模型、不改模型结构,全靠「一次只把一个计算层放进显存」的办法,把显存需求从「整个模型的大小」降到「单独一层的体积」。该项目在 GitHub 上已获得约 3.25 万 star,对只有普通显卡的个人开发者、学生和研究者来说,是本地运行 Llama、Qwen、DeepSeek 等主流大模型最直接的工具之一。
它解决什么问题
大语言模型(LLM,能理解和生成文本的人工智能模型)在运行时,要把模型文件装入显卡的显存(VRAM,显卡上的高速内存,容量远小于电脑内存)。模型越大,需要的显存越多:参数规模 70B(B 是 billion 的缩写,70B 即 700 亿)的模型,按半精度(每参数 2 字节)计算需约 140GB 显存,而主流消费级显卡一般只有 8GB 或 12GB。
过去解决显存不够的常规手段有三类:量化(把模型里的数字从高精度换成低精度以压缩体积,但会损失部分精度)、蒸馏(用大模型「教」出一个小模型,需要额外训练)、剪枝(删掉部分不重要的参数)。它们要么有质量损失,要么操作复杂。
AirLLM 绕开了「整体载入」这条路:大模型由几十上百个结构相同的计算层(layer,神经网络中一层层的处理单元)堆叠而成,推理时数据要依次经过每一层。AirLLM 每次只把当前需要的那一层放进显存,算完立刻换出、再载入下一层。于是显存需求只取决于「单层多大」,与模型总参数规模基本无关。
一张表看懂它能跑什么模型
官方给出的实测显存数据(指模型加载所需,生成时的峰值会略高):
- Llama 3 70B(700 亿参数):约 4GB
- Llama 3.1 405B(4050 亿参数):约 8GB
- DeepSeek-V3(6710 亿参数):约 12GB
- Qwen3-235B(MoE 结构):约 3GB
- Kimi K3(2.8T 参数,即 2.8 万亿):约 3.7GB
其中两个数字最反直觉:DeepSeek-V3 有 6710 亿参数,却只要 12GB 显存;Kimi K3 达到 2.8 万亿参数,反而只占约 3.7GB。原因是 Kimi K3 和 Qwen3-235B 都是 MoE 模型。MoE(混合专家,Mixture of Experts)是一种模型结构:总参数量很大,但处理每个输入时只激活其中一小部分「专家」子网络,再叠加 AirLLM 的逐层加载,单张显卡就能运行。
使用门槛:三行代码
AirLLM 以 Python 包形式发布,安装和调用都很简单。先安装:
pip install airllm
然后加载模型并生成文本,核心代码只需几行:
from airllm import AutoModel
# 传入 Hugging Face 上的模型 ID 即可
model = AutoModel.from_pretrained("Qwen/Qwen3-32B")
input_tokens = model.tokenizer("What is the capital of the United States?",
return_tensors="pt", truncation=True, max_length=128)
generation_output = model.generate(input_tokens["input_ids"].cuda(), max_new_tokens=20)
print(model.tokenizer.decode(generation_output.sequences[0], skip_special_tokens=True))
AutoModel 会自动识别模型类型,Hugging Face 上的主流开源模型(Llama、Qwen、DeepSeek、Mistral、Phi、Gemma、ChatGLM 等)基本开箱即用。第一次运行时,AirLLM 会把模型拆成逐层分片保存到磁盘,因此需要预留足够磁盘空间;此后的推理直接读取这些分片,不用重复拆分。项目更新也较活跃,2026 年 8 月发布了 v3.2.0,新增了对 Qwen 新版视觉模型的低显存支持。
速度优化:块级量化约 3 倍加速
低显存运行保证的是「跑得动」,速度主要受限于从磁盘逐层读取权重。AirLLM 为此提供了可选的块级量化(block-wise quantization,把模型按小块做低精度压缩)——分 4bit 与 8bit 两档,官方称推理速度最多可提升约 3 倍,精度损失几乎可以忽略。启用方式是在加载时加一个参数:
model = AutoModel.from_pretrained("Qwen/Qwen3-32B", compression="4bit")
它与传统量化的区别在于:传统量化通常要同时压缩权重和激活值(推理过程中的中间数据)才能提速,精度更容易受损;而 AirLLM 的瓶颈在磁盘加载,只需压缩权重部分,因此更不容易损失精度。
平台支持与三个注意事项
AirLLM 支持 Linux、macOS(Apple 芯片,需搭配 mlx 框架)和纯 CPU 推理;Windows 用户可通过 WSL(Windows 自带的 Linux 子系统)使用。使用中有三点要注意:
- 磁盘空间:模型拆分很占磁盘。若报
MetadataIncompleteBuffer错误,通常就是磁盘满了,需要清理空间后重试; - 受控模型:Meta 的 Llama 等部分模型在 Hugging Face 上属于受控模型(gated model),需先到模型主页申请访问权限,再通过
hf_token参数传入令牌; - 显存留余量:表中的数字是加载模型所需显存,实际生成时峰值会更高,建议按表中数值再留出余量。
结论
AirLLM 证明了「显存不够」不再是个人开发者本地运行大模型的最大障碍:70B 模型只需 4GB 显存,671B 的 DeepSeek-V3 也只要 12GB。它的取舍很明确——用更慢的逐层加载换取极低的显存门槛,适合实验、学习、微调验证等非高并发场景。如果你的显卡只有 8GB 或更少,又想在本地跑 Llama、Qwen、DeepSeek 这类开源模型,AirLLM 是最值得先试的工具之一。