大模型本地部署最大的障碍是内存:一个 350 亿参数的模型,权重就有几十 GB,普通 Mac 根本装不下。edge0 是一个开源的大模型推理框架——它是负责把训练好的大模型加载起来、对外提供问答服务的软件——专门解决这个问题:它让苹果芯片 Mac(M1 到 M4)用 SSD 固态硬盘当「外挂内存」,按需加载模型权重,把 35B 参数的混合专家大模型跑进 24GB 内存的 Mac mini。

实测效果:每秒生成 14.9 到 17.7 个 token(token 是模型读写文本的最小单位,大致相当于半个到一个汉字;每秒 15 个 token 约等于每分钟 900 字)。项目以 Apache-2.0 许可开源,目前约 1100 个 star、94 个 fork,代码全部是 Python。

适合谁:拥有 M 系芯片 Mac 的开发者,尤其是内存 16GB 到 24GB、没有大显存独立显卡、又想本地跑大模型的用户。

难点在哪

混合专家模型(MoE)把一个大模型拆成许多「专家」小网络;edge0 的 35B 档就有 256 个专家。处理每个词时,模型只唤醒其中 4 到 8 个专家,算力开销因此远小于同大小的普通模型。但所有专家的权重仍然都在硬盘上——一次性全部装入内存依然不可能。edge0 用三个机制解决这个问题。

机制一:SSD 专家按需加载

模型文件放在 SSD 上,运行时只把当前要用的几个专家读进内存,用完就释放。峰值内存由「同时活跃的专家数」决定,与模型总参数无关。实测 35B 档在 Mac mini M4 Pro(24GB 内存)上,峰值活跃内存只有 2.9GB。

机制二:预路由

专家从硬盘加载需要时间,如果等模型算完「该用哪个专家」再去读盘,生成就会卡顿。edge0 训练了一个预测头(prerouter),提前一步预测下一步需要的专家,让「读盘」和「计算」重叠进行。官方数据:解码吞吐最高提升 59%。

机制三:Recover-LoRA

模型被压缩成 4-bit 低精度(量化)后,质量会有损失。edge0 把原始模型冻结不动,用「蒸馏」训练出 LoRA 适配器(一种只训练少量附加参数的低成本微调技术,不改动原模型)把损失补回来。在开源评测平台 OpenCompass 上,35B 档相对原始 fp16 精度模型平均只损失 3.9 分(百分制),8B 档损失 2.8 分,其中 MMLU-Pro 单项甚至反超原模型。

两个档位与实测性能

edge0 发布两个档位,模型、LoRA、预路由适配器打包在一个目录里,下载即用:

档位基础模型模型体积解码速度峰值活跃内存
edge0-35bQwen3.5-MoE 35B-A3B约 23GB14.9–17.7 token/秒2.9GB
edge0-8bLing 3.0(8B 级)约 4.2GB23.9–25.3 token/秒1.0GB

以上为官方在 Mac mini M4 Pro(24GB 内存)上的实测数据。

怎么开始用

安装后,edge0 serve edge0-35b 一条命令启动服务,接口兼容 OpenAI 格式,用 curl 就能调用;edge0 demo edge0-35b 可直接对话体验。模型从 Hugging Face(全球最大的开源模型托管平台)下载,目录自带全部适配器,无需手动合并。目前仅支持 Apple Silicon Mac,NVIDIA 显卡(CUDA)版在路线图上。

结论

edge0 的核心思路是「用硬盘换内存」:它让没有大显存的 Mac 用户也能本地跑 35B 级大模型。速度不如旗舰显卡方案,但门槛低、完全免费、数据不出本机。如果你有 M 系芯片 Mac 并想离线体验大模型,edge0 值得直接装来试试。