推理引擎是决定大模型服务成本与速度的关键软件层:它负责调度模型、批量处理请求,同样一块显卡,好的引擎能多扛好几倍的请求量。Datawhale 与 RadixArk 联合推出的免费开源课程《从零手搓SGLang》(GitHub 仓库 datawhalechina/zero-to-sglang,2026 年 8 月 24 日开课,中英双语),要教的就是这层软件怎么写:从推理最核心的问题讲起,带你把一个简化版推理引擎 mini-sglang 从第一行代码写出来,再回头吃透真实 SGLang 的源码。它适合有 Python 和 PyTorch 基础、想弄清「大模型到底是怎么跑起来的」的开发者,学 Part I 不需要 GPU。

这门课补的缺口很实际:大模型应用爆发后,推理成本和延迟成了真正的瓶颈,但市面上的教程要么只讲概念不动手,要么直接让人面对几十万行源码,不知从哪下手。课程把难度切成四段,每段都有明确产出。

课程的四段式路线

Part 0 开课之前:先在自己的 GPU 上部署一个 SGLang 服务,跑起 Qwen3-0.6B(一个轻量开源模型),建立整体印象。

Part I 基础概念:不写代码,把推理的底层概念讲清楚——KV Cache(缓存已算过的中间结果,避免每个新词从头重算)为什么必须有;prefill(一次性读完整段输入)与 decode(逐字生成输出)差在哪;compute-bound(受计算速度限制)与 memory-bound(受显存读取速度限制)分别指什么。

Part II 从零手搓 mini-sglang:实战环节,顺序加上前向传播、自回归生成、KV Cache、HTTP 服务、Continuous Batching(连续批处理:不等一批请求凑齐,边生成边接新请求,提高显卡利用率)、Paged KV Cache(像操作系统分页一样管理显存缓存,减少浪费)、RadixAttention(SGLang 的招牌技术,把公共前缀缓存共享给不同请求)、张量并行(拆到多张显卡并行计算)与投机解码(小模型先猜、大模型验证,加速生成)。

Part III 回到真实 SGLang:量化(把模型参数压到低精度,换取更小显存占用和更快速度)、分层缓存、Prefill-Decode 分离等前沿优化,在源码层面讲清具体实现。

Part IV 参与开源:学 profiling 与 trace 分析,走通给 SGLang 提交第一个 PR 的全流程。

学习门槛与硬件要求

前置要求只有三条:熟练 Python、熟悉 PyTorch、懂线性代数与概率统计基础。硬件很宽松——Part I 完全不需要 GPU;Part II 大部分代码在 CPU 上就能调试,只有完整的性能验证建议用 GPU(云服务也行)。学习路径是四步走:先读 Part I 建立整体认知,再跟 Part II 手写引擎,进 Part III 对照真实源码,最后在 Part IV 完成第一次贡献。

项目现状与进度

课程由 Datawhale 与 RadixArk 共同发起,后者是 SGLang 团队创立的公司,部分章节由 SGLang 官方成员直接编写。课程按章节滚动更新:Part 0 已完成,Part I 正在 review(2026 年 9 月上旬),Part II 计划 9 月 14 日至 10 月 4 日编写。截至抓取时,仓库已有 656 star、50 fork、78 次提交,采用知识共享 CC BY-NC-SA 4.0 许可。

结论

想弄清楚大模型「跑起来」背后到底发生了什么,这门课是目前少见的全链路教程:概念、手写、读源码、提 PR 四步都有代码可跟。零 GPU 也能起步,中英双语,git clone github.com/datawhalechina/zero-to-sglang 即可开始学习。