Triton 是一个开源的 GPU 编程语言与编译器,专门用来编写深度学习中的高性能计算算子。算子就是神经网络里的一次具体计算单元,比如矩阵乘法、注意力计算,它写得好不好,直接决定模型在 GPU 上跑得快不快。Triton 的卖点是用接近 Python 的语法写出这类算子,把优化工作交给编译器自动完成。这个项目在 GitHub 上已有 20.1k star,最新稳定版 3.8.0 于 2026 年 8 月 28 日发布,是 AI 框架生态里不可忽视的基础设施。

为什么需要一门新语言

写 GPU 算子的传统方式是 CUDA。CUDA 是英伟达(NVIDIA)提供的 GPU 编程框架,用类 C++ 的语法编写,给开发者完全的底层控制,但门槛高、代码量大——写一个简单算子也要处理线程调度、显存布局等大量细节。

另一类方案是直接用现成的深度学习框架(比如 PyTorch 内置的算子),开箱即用,但只能用框架预先提供的功能。想实现一个研究中的新算法,往往要等框架更新,或者只能自己动手。

Triton 想同时解决这两个问题:比 CUDA 更容易上手,比通用框架更灵活。它的官方定位是提供开源环境,以高于 CUDA 的生产力、高于其他领域特定语言(DSL)的灵活性来编写自定义算子——DSL 指为特定领域设计的编程语言,Triton 这门语言就是专为 GPU 计算而生的。

它在 AI 生态里的位置

Triton 和 PyTorch 关系密切:生态中不少高性能算子的开源实现都基于 Triton 编写,例如 FlashAttention——一种把注意力计算加速数倍的算法,它的常见实现就包含 Triton 版本。GitHub 的依赖统计显示,有超过 8.8 万个下游项目在依赖这个仓库。

社区也在持续活跃:第 3 届 Triton 开发者大会于 2025 年 10 月 21 日在美国加州山景城的微软园区举办,会议录像与幻灯片均已公开,任何人都可以免费观看。

它是怎么工作的

Triton 由语言和编译器两部分组成。开发者用 Python 风格的代码写出算子,编译器负责把它翻译成 GPU 能执行的指令。编译器底层基于 LLVM——一套开源的编译器基础设施,Rust、Swift 等语言的编译器也构建在它之上;Triton 2.0 版本还将后端重写为 MLIR(LLVM 生态中用于构建编译器的中间表示框架),并支持了连续矩阵乘法等新特性。

硬件支持方面:Triton 支持英伟达 GPU(计算能力 8.0 及以上)和 AMD GPU(ROCm 6.2 及以上,ROCm 是 AMD 的 GPU 计算平台),CPU 后端正在开发中。从仓库代码构成看,约 40.6% 是 MLIR、32.7% 是 Python、26% 是 C++。

上手很简单

安装只需一条命令:pip install triton,官方提供 CPython 3.10 到 3.14 的预编译安装包。安装说明和教程都在官方文档(triton-lang.org)。

对还没有 GPU 的开发者,Triton 提供了解释器模式:可以直接在 CPU 上运行教程示例,甚至能在算子代码里插入 Python 断点调试。这意味着零硬件成本也能把 Triton 的语法和概念学起来。

结论

Triton 解决的是「想写 GPU 高性能算子、又不想从头啃 CUDA」的痛点:Python 语法负责好写,编译器负责优化,同时保持比通用框架更高的灵活性。对做深度学习研究、模型推理加速,或者想入门 GPU 编程的开发者来说,它是目前最值得关注的开源选择之一——装一个 Triton、跑通官方教程,入门路径比从 CUDA 开始平缓得多。