Lemonade 是一个开源的本地 AI 服务器项目(GitHub 仓库 lemonade-sdk/lemonade,star 5.6k、fork 481,Apache-2.0 许可)。它把聊天、代码补全、语音合成、图像生成这类通常要调用云端 API 的能力,全部放到你自己的电脑上运行——免费,且数据不出本机。项目由社区维护,AMD 工程师深度参与优化,在 Ryzen AI、Radeon、Strix Halo 等平台上针对性地榨取性能。

两种形态:Server 与 Embeddable

Lemonade 提供两种使用方式。

Lemonade Server 是常驻本机的服务。安装后它对外暴露与 OpenAI、Anthropic、Ollama 兼容的 API,数百款现有应用只需改配置即可连上来,相当于把云端 API 端点换成 http://localhost:13305/v1。

Embeddable Lemonade 是可移植的二进制文件。你可以把它直接打包进自己的应用,让应用自动获得多模态本地 AI 能力,不需要安装器、不需要品牌信息、不上报遥测。

一条命令跑多模态模型

Lemonade 的 CLI 把「下载模型 + 启动推理」压缩成单条命令:

  • lemonade run Gemma-4-E2B-it-GGUF:运行聊天模型
  • lemonade run SDXL-Turbo:图像生成
  • lemonade run kokoro-v1:语音合成
  • lemonade run Whisper-Large-v3-Turbo:语音转文字
  • lemonade launch claude:把编码能力接到 Claude 类工作流

模型通过 lemonade pull 或内置 Model Manager 下载,支持 GGUF、FLM、ONNX 格式;自定义模型可以从 Hugging Face 或 ModelScope 拉取,并保留来源以便后续更新。

硬件与推理后端

Lemonade 的引擎覆盖主流硬件路线,各后端对应关系如下:

  • NVIDIA GPU:CUDA 后端,要求 Turing 及以上架构(RTX 20 系列起)
  • AMD GPU / iGPU:ROCm、Vulkan 后端,覆盖 RDNA3、RDNA4 与 Strix Halo
  • NPU:FLM、ryzenai-llm 后端,面向 XDNA2 NPU
  • Apple Silicon:Metal 后端(macOS)
  • 纯 CPU:llamacpp 的 CPU 路径,x86_64 与 ARM64 均可

运行 lemonade backends 可以查看当前机器实际可用的后端,再决定用哪个引擎跑。

安装与接入

支持平台包括 Windows 11(MSI 安装包)、Ubuntu 24.04+、Debian、Fedora 43+、Arch Linux、macOS、Docker 与 Snap。接入方式上,任何 OpenAI 兼容客户端只需把 base_url 指向 http://localhost:13305/v1,api_key 填任意占位值即可。

隐私设计

项目声明:程序不会向任何联网系统传输信息,除非用户主动请求;只有在用户下载模型或查询模型注册表时,才会按所选模型源联系 Hugging Face Hub 或 ModelScope。对数据敏感、不便上云的场景,这是本地部署的核心价值。

现状与结论

截至 2026 年 8 月底,Lemonade 最新版本为 v11.8.1(2026-08-28 发布),仓库累计 1573 次提交、148 名贡献者、70 个 release。想在本地免费且私密地跑多模态 AI,又恰好有 AMD 平台或 NPU 设备,Lemonade 是当前值得先试的开源方案。