把训练好的大模型(比如 DeepSeek、Qwen)部署成线上服务,让 App 和网站里的用户随时调用,中间需要一层负责接收请求、调度 GPU 计算、逐字生成回答的软件,这层软件叫「推理引擎」。SGLang 就是目前最主流的开源推理引擎之一:由非营利 AI 研究组织 LMSYS 托管,GitHub 上已有 35.6k star、8.7k fork,官方称全球超过 40 万块 GPU 正用它跑生产环境,每天生成数万亿个 token(token 是模型读写文本的最小单位,大体相当于一个词)。

它的定位很明确:一个把大模型服务做得更快、更省、更扛并发的开源框架。适合三类人——要上线大模型服务的团队、做 AI 应用的开发者、想低成本自建模型服务的个人开发者;部署规模从单张显卡到上千张显卡的集群都能覆盖。

大模型服务难在哪

训练好的模型只是一颗「会答题的大脑」,要让它能被外部程序调用、同时服务很多用户,得解决三个问题:

  • 速度:模型逐字生成回答,用户等多久直接取决于引擎调度效率;
  • 成本:GPU(图形处理器,AI 计算的主力芯片)按时间计费,同样的请求占用越少算力越省钱;
  • 并发:成百上千用户同时提问时,调度不当要么 GPU 大量闲置,要么请求排队,谁都慢。

SGLang 的优化全部围绕这三件事展开。

它靠这几招变快

前缀缓存(RadixAttention):多个用户围绕同一份长文档提问时,模型要反复「重读」文档的公共部分。SGLang 把这段计算缓存下来复用,效果类似多人同时翻同一本书,公共页只抄一遍。官方 2024 年 1 月发布时称,这项技术最多带来 5 倍推理加速。

连续批处理(continuous batching):传统做法是凑满一批请求才开始计算,先到的也得干等。SGLang 允许请求随时插队进入计算,一个请求结束立刻有新的补上,GPU 的空闲时间被压到最低。

投机解码(speculative decoding):用一个便宜的小模型先草拟几个候选词,大模型一次性校验整段草稿,对了就整段采纳。这样大模型每步能生成多个词,而不是一个词一个词地往外挤。

结构化输出:当程序要求模型返回 JSON 这类固定格式时,SGLang 用有限状态机(一种按规则一步步转移状态的计算模型)约束生成过程,保证输出格式合法,开发者不用再写一堆容错代码。官方称这项优化让 JSON 解码快了 3 倍。

此外还有:prefill-decode 分离(把「理解问题」和「逐字作答」两个阶段拆开分别调度)、FP4/FP8/INT4/AWQ/GPTQ 等多种量化方案(压缩模型精度来降低显存占用),以及张量、流水线、专家、数据四种并行方式,分别对应不同规模的部署场景。

硬件和模型的支持范围

  • 硬件:NVIDIA(GB200/B300/H100/A100 等)、AMD(MI300/MI355)、Intel Xeon CPU、Google TPU、华为昇腾 NPU;
  • 模型:Llama、Qwen、DeepSeek、Kimi、GLM、GPT-OSS、Gemma、Mistral 等主流开源模型,也支持 embedding 模型(把文本转成向量的模型)、reward 模型(给模型回答打分的模型),以及 WAN、Qwen-Image 这类图像视频生成模型;兼容大多数 Hugging Face 模型库。

谁在实际用它

官方 README 列出的采用方包括 xAI、NVIDIA、AMD、Intel、LinkedIn、Cursor、Oracle Cloud、Google Cloud、Microsoft Azure、AWS,以及 MIT、斯坦福、UC Berkeley、清华等高校,国内有百度、蚂蚁、阿里、腾讯。2025 年 6 月,SGLang 获得 a16z(美国知名风投)的第三批开源 AI 资助。

它还是多个模型「后训练」框架的推理底座:AReaL、Miles、verl 这类做强化学习(一种让模型在试错中自我改进的训练方式)与模型微调的工具,都默认接 SGLang 来完成生成环节。

上手成本

安装用 pip install sglang 即可。它提供 OpenAI 兼容 API——如果应用已经在用 OpenAI 接口,把地址换成自建的 SGLang 服务就能跑,改动很小。最新版本 v0.5.19 于 2026 年 9 月 5 日发布,采用 Apache-2.0 开源协议,可商用。

值得记住的

SGLang 已经是 2026 年开源大模型推理的事实标准之一:覆盖面从单卡到大规模集群,DeepSeek-V4、Kimi K3 等新模型发布当天即可支持,官方博客称在 NVIDIA GB300 NVL72 硬件上实现了 25 倍推理性能提升。如果你需要部署开源模型对外提供服务,SGLang 和 vLLM 是目前最值得优先评估的两个引擎。