免费大模型的额度可以叠起来用。FreeLLMAPI 把 34 家提供商的免费额度聚合到一个 OpenAI 兼容的 API 端点:635 个免费模型端点、474 个模型家族,合计每月约 74 亿 token,全部通过一个 /v1 地址对外提供。这个项目在 GitHub 上已有 23.1k star、3.2k fork,最新版 v0.9.0 于 2026 年 8 月 26 日发布,采用 MIT 协议。

为什么需要聚合层

主流 AI 实验室都提供免费额度,但单看每一家都是「玩具」:一个月几百万 token、一天几千次请求。34 家叠在一起,才有每月 74 亿 token 的可观算力。问题在于手动去叠很痛苦——34 套 SDK、34 套限速规则、34 个可能出错的位置都要自己维护。FreeLLMAPI 把这些压缩成一个端点,客户端只需要对接它一家。

路由是核心机制

请求进来后,路由器按优先级挑选一个健康且未超限的模型,解密对应提供商的密钥后调用;遇到 429 或 5xx 就冷却该密钥,自动切换到链条里的下一个模型。每个 key 的 RPM、RPD、TPM、TPD 单独计数,保证请求不会顶穿任何一家的免费上限。提供商密钥用 AES-256-GCM 加密存放在本地 SQLite,应用侧只看到一个统一的 bearer token。

模型目录会自动更新。路由器每天两次从 freellmapi.co 拉取带签名的目录,新模型、配额调整和兼容性修复自动落到本地。免费版跟随月度快照,一个模型加入实时目录 30 天后才会进入免费版;付费版(19 美元/年,或 49 美元一次性买断)当天同步实时目录。

支持哪些提供商

34 家里包括 Google、Groq、Cerebras、Mistral、OpenRouter、Cloudflare、Cohere、智谱(Z.ai)、NVIDIA、HuggingFace,以及 ModelScope 上的 Qwen3、DeepSeek V4、GLM-5(后者需要阿里云账号绑定)。常用国产模型都在默认列表里。此外还支持添加任意 OpenAI 兼容的自定义端点,本地 llama.cpp、Ollama、vLLM 都可以挂进来。

上手三步

第一步,安装。有 Docker 的一行命令即可:

curl -fsSL https://freellmapi.co/install.sh | bash

脚本会生成加密密钥、拉取镜像并启动容器,重复运行是安全的,已有配置和密钥会保留。Windows 用户也可以从 Releases 下载桌面版安装包(.exe),装在托盘里运行,无需配置账号密码。

第二步,配置。打开 http://localhost:3001,在 Keys 页面添加各提供商的 API key,按偏好排序 Fallback Chain,然后在页面头部复制统一 API key。

第三步,接入。把 OpenAI SDK 的 base_url 指向 http://localhost:3001/v1、api_key 填统一 key 即可。Claude Code、Codex CLI、Cline、Roo Code、Continue、Aider、Cursor 等 18 种客户端都有对应的一键配置命令,例如:

npx freellmapi setup-claude --url http://localhost:3001 --api-key unified-key

配置生成器支持 dry-run 预览,写入前会先备份现有配置,不会覆盖已有内容。

需要留意的限制

免费层的局限,项目自己在 README 里写得很清楚:没有前沿模型、延迟不稳定、没有 SLA,一天中晚些时候头部模型的日限额会被耗尽,有效智能水平明显下降,到 UTC 午夜重置。官方定位是「个人实验与学习」,明确建议生产环境换成付费 API——把免费额度当稳定推理基座用,会出问题。

结论

FreeLLMAPI 解决的问题很具体:免费额度单家是玩具、堆起来是真算力,它负责把「堆」这件事自动化。个人项目、学习、原型验证,值得一试;要上生产的服务,按它的建议换付费 API。