大模型本地部署最大的障碍是内存:一个 350 亿参数的模型,权重就有几十 GB,普通 Mac 根本装不下。edge0 是一个开源的大模型推理框架——它是负责把训练好的大模型加载起来、对外提供问答服务的软件——专门解决这个问题:它让苹果芯片 Mac(M1 到 M4)用 SSD 固态硬盘当「外挂内存」,按需加载模型权重,把 35B 参数的混合专家大模型跑进 24GB 内存的 Mac mini。
实测效果:每秒生成 14.9 到 17.7 个 token(token 是模型读写文本的最小单位,大致相当于半个到一个汉字;每秒 15 个 token 约等于每分钟 900 字)。项目以 Apache-2.0 许可开源,目前约 1100 个 star、94 个 fork,代码全部是 Python。
适合谁:拥有 M 系芯片 Mac 的开发者,尤其是内存 16GB 到 24GB、没有大显存独立显卡、又想本地跑大模型的用户。
难点在哪
混合专家模型(MoE)把一个大模型拆成许多「专家」小网络;edge0 的 35B 档就有 256 个专家。处理每个词时,模型只唤醒其中 4 到 8 个专家,算力开销因此远小于同大小的普通模型。但所有专家的权重仍然都在硬盘上——一次性全部装入内存依然不可能。edge0 用三个机制解决这个问题。
机制一:SSD 专家按需加载
模型文件放在 SSD 上,运行时只把当前要用的几个专家读进内存,用完就释放。峰值内存由「同时活跃的专家数」决定,与模型总参数无关。实测 35B 档在 Mac mini M4 Pro(24GB 内存)上,峰值活跃内存只有 2.9GB。
机制二:预路由
专家从硬盘加载需要时间,如果等模型算完「该用哪个专家」再去读盘,生成就会卡顿。edge0 训练了一个预测头(prerouter),提前一步预测下一步需要的专家,让「读盘」和「计算」重叠进行。官方数据:解码吞吐最高提升 59%。
机制三:Recover-LoRA
模型被压缩成 4-bit 低精度(量化)后,质量会有损失。edge0 把原始模型冻结不动,用「蒸馏」训练出 LoRA 适配器(一种只训练少量附加参数的低成本微调技术,不改动原模型)把损失补回来。在开源评测平台 OpenCompass 上,35B 档相对原始 fp16 精度模型平均只损失 3.9 分(百分制),8B 档损失 2.8 分,其中 MMLU-Pro 单项甚至反超原模型。
两个档位与实测性能
edge0 发布两个档位,模型、LoRA、预路由适配器打包在一个目录里,下载即用:
| 档位 | 基础模型 | 模型体积 | 解码速度 | 峰值活跃内存 |
|---|---|---|---|---|
| edge0-35b | Qwen3.5-MoE 35B-A3B | 约 23GB | 14.9–17.7 token/秒 | 2.9GB |
| edge0-8b | Ling 3.0(8B 级) | 约 4.2GB | 23.9–25.3 token/秒 | 1.0GB |
以上为官方在 Mac mini M4 Pro(24GB 内存)上的实测数据。
怎么开始用
安装后,edge0 serve edge0-35b 一条命令启动服务,接口兼容 OpenAI 格式,用 curl 就能调用;edge0 demo edge0-35b 可直接对话体验。模型从 Hugging Face(全球最大的开源模型托管平台)下载,目录自带全部适配器,无需手动合并。目前仅支持 Apple Silicon Mac,NVIDIA 显卡(CUDA)版在路线图上。
结论
edge0 的核心思路是「用硬盘换内存」:它让没有大显存的 Mac 用户也能本地跑 35B 级大模型。速度不如旗舰显卡方案,但门槛低、完全免费、数据不出本机。如果你有 M 系芯片 Mac 并想离线体验大模型,edge0 值得直接装来试试。