给 AI 智能体跑模型,过去往往要同时部署好几个服务:一个管文字转向量、一个管文档转文字、一个管安全审核、一个管生成回答,每个服务各拉一套模型,接口互不相同,还要自己拼装。**SIE(Superlinked Inference Engine)**想把这堆事情合成一件:它是一款开源的推理服务器(跑 AI 模型、对外提供调用接口的服务程序),用一个集群、一套 OpenAI 兼容 API,按需加载 100 多个模型,覆盖智能体干活所需的全部任务。项目托管在 GitHub(superlinked/sie),采用 Apache-2.0 协议,目前约 3000 star,适合想自托管模型、又不想为每个任务单独维护一套模型服务的开发者或团队。
智能体的模型服务为什么难维护
智能体(agent)是能自己规划步骤、调用工具完成任务的 AI 程序。它干活时会用到多种模型:从资料里找相关内容需要向量检索;读 PDF 和扫描件需要 OCR(光学字符识别,把图片里的文字抠出来);让模型按固定格式输出需要结构化输出;回答用户前还要过安全审核。常见做法是每个任务单独部署一个模型服务器,任务越多服务器越多,接口五花八门,运维成本直线上升。SIE 把这种架构称为「补丁式」,它的方案是把这些任务统一到一个系统里。
一个 API 覆盖五类任务
SIE 把智能体常用的模型能力分成五类,每一类都有预置好的模型配置:
- 搜索与检索:把内容转成向量(用一串数字表示文字含义的格式),按相似度匹配相关内容,模型如 bge-m3、splade-v3、colbertv2,重排(对粗筛结果进一步精排)用 qwen3-reranker
- 文档转 Markdown:把 PDF、Office 文件、扫描件识别成干净的 Markdown 文本,用 LightOnOCR、GLM-OCR、MinerU、Docling 等模型
- 结构化输出:让模型按固定格式输出,例如提取实体、生成 JSON,用 gliner2、nuner-zero 等模型
- 内容安全:对模型输出做安全判定,用 granite-guardian-2b
- 运行智能体循环:规划步骤、调用工具、生成回答,用 qwen3.6-27b 等开源大模型,支持流式输出
五类任务走同一个 API,调用方不需要关心背后是哪台服务器在跑。
100 多个模型,按需加载
SIE 不要求把所有模型常驻内存。它内置 100 多个模型的目录(Stella、SPLADE、Qwen3、GLiNER、SigLIP 等,其中向量模型经过 MTEB 基准评测),支持多模型同时服务,每个模型按需加载,长期不用时按 LRU 策略(内存不够时优先卸载最久没用的模型)自动腾退。首次调用某个模型会先下载权重,之后直接走本地推理。
OpenAI 兼容,迁移成本低
SIE 对外提供 OpenAI 兼容 API,包括 /v1/embeddings、/v1/chat/completions、/v1/completions、/v1/responses。已经在用 OpenAI 接口的代码,把地址指到 SIE 服务就能切换,文字转向量和文本生成两条链路都打通,这也是它主打「无缝迁移」的原因。
从单机 Docker 到生产集群
上手用 Docker 一行命令就能起服务:CPU 镜像、NVIDIA GPU 镜像、带 OCR 模型的镜像分开提供,避免模型依赖互相冲突。要上生产,SIE 自带 Kubernetes 部署方案:Helm chart 一键安装,包括负载均衡网关(把请求分发给多个实例)、KEDA 自动扩缩(按负载自动增减实例,可以缩到零)和 Grafana 监控面板;阿里云 ACK、AWS EKS、Azure AKS、Google GKE 四个云平台都有对应的 Terraform 模块。
生态与周边
SIE 提供 Python(sie-sdk)和 TypeScript(@superlinked/sie-sdk)两种 SDK;与 LangChain、LlamaIndex、Haystack、DSPy、CrewAI 等智能体框架,以及 Chroma、Qdrant、Weaviate、LanceDB 等向量数据库(按「含义相似」而非「字面相同」检索数据的存储,常用于 AI 应用的记忆与联想)都有现成集成。它还支持 MCP 边缘模式(MCP 是让 AI 应用连接外部工具和数据的开放协议),可以把文档处理任务从 Claude 等 MCP 客户端卸载到自己的集群,省下这些客户端的 token 消耗。项目默认收集匿名使用数据(版本、操作系统、架构、GPU 类型),不收集 IP 和请求内容,可用 SIE_TELEMETRY_DISABLED=1 或 DO_NOT_TRACK=1 环境变量关闭。
结论
如果你正在搭建或维护智能体应用,厌倦了为每个模型任务单独部署服务器,SIE 值得一试:一个集群、一套 OpenAI 兼容 API、100 多个按需加载的模型,从向量检索到内容安全全部覆盖,Apache-2.0 完全开源,单机 Docker 就能跑,生产环境也有完整的 Kubernetes 方案。