在本地跑大模型,最麻烦的不是下载,而是不知道该选哪个模型、跑多快。Magnitude 是一个开源推理服务器,专门解决这个问题:它分析你的芯片、内存和带宽,推荐适配的本地模型并预估每秒生成 token 数,然后自动下载、调优、运行,直接接入你正在用的 AI 编码 Agent。仓库 magnitudedev/magnitude 已有 1.8k Star,采用 Apache-2.0 协议,最新版本发布于 2026 年 9 月 2 日。

本地模型的两道门槛

第一道是选型。同一系列的模型有十几个量化版本,内存不同的机器能跑的型号也不一样,普通人很难判断该装哪个。第二道是接入。模型跑起来之后,还要写配置让编码 Agent 连上它,调参数、测速度,每一步都增加折腾成本。

Magnitude 把这两步都收进了 CLI:一条命令安装,一个交互式向导完成评估、推荐、下载和接入。

工作机制:先画像,再推荐

Magnitude 先对你的机器做硬件画像——芯片型号、内存大小、带宽——再对照模型目录给出推荐,每个推荐都带预估速度(tok/s)。选定后自动下载并完成端到端调优,包括投机解码(speculative decoding)和并发设置。

模型按需加载:Agent 需要时才载入内存,空闲或内存紧张时自动卸载,不长期占用显存或内存。

与 Ollama 的差异

很多人用 Ollama 跑本地模型。Magnitude 官方 FAQ 里给了对比:让 Agent 自己装 Ollama 是「盲猜」——它不知道你的硬件支持什么量化、跑多快;而 Magnitude 提供按机器计算好的推荐目录、自动写入的 harness 配置,以及为 Agent 工作负载设计的推理服务。

接入你正在用的 Agent

Magnitude 支持 Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi 和 Cline,也可以使用内置 harness。安装方式:

npm i -g @magnitudedev/cli
magnitude setup

想让 Agent 全程引导设置,把这段话发给它:「用 Magnitude CLI 为我的机器设置本地模型,安装后运行 magnitude docs onboarding 并按说明操作」,它会自己完成硬件评估、模型选择和接入配置。

支持 macOS 和 Linux,Windows 需通过 WSL 使用。

隐私、离线与扩展

所有提示词、文件和模型都留在本机,不需要 API key,也没有 token 计费;模型下载完成后可以完全离线运行。目录之外,也可以从 Hugging Face 下载兼容的 GGUF 模型手动导入。

项目现状

仓库 2026 年 7 月 13 日提交首个代码,目前 594 次提交、45 个版本发布,最新版本 @magnitudedev/cli@0.0.11 于 2026 年 9 月 2 日发布。技术栈以 TypeScript(75%)和 Rust(22.5%)为主,共 5 位贡献者。

适合谁用

如果你已经在用 Claude Code、Codex、OpenClaw 这类编码 Agent,想省掉 API 费用,或要求数据不出本机,Magnitude 把「选模型—下载—接入」做成了向导流程,是目前上手本地模型门槛最低的开源方案之一。

如果你在找让编码 Agent 跑本地模型的办法,Magnitude 值得直接上手试一次——选型、下载、接入都在一个 CLI 里完成。