本地大模型运行时 Ollama:从一行命令安装到接入编码 Agent
Ollama 把本地运行开源大模型的安装、拉取与启动压缩成一条命令:装好运行时后执行 ollama run 即可对话,自带 REST API 与 Python、JavaScript 客户端,并提供 ollama launch 把本地模型接入 Claude Code、Codex 等编码 Agent。
项目的关键数字:179.4k star、17.6k fork,MIT 许可,主体用 Go 编写,推理引擎基于 llama.cpp(由 Georgi Gerganov 创立),最新版本 v0.32.15 于 2026 年 8 月 19 日发布。
本地推理的三件事
过去想在本机跑大模型,要自己处理下载权重、编译推理引擎、写对接代码三件事。Ollama 把这三件事收敛成 ollama run 一条命令。模型通过名字直接调用,比如 ollama run gemma4 会拉取 Gemma 4 并进入对话;模型库在 ollama.com/library 集中管理,支持 Kimi-K2.6、GLM-5.2、MiniMax、DeepSeek、gpt-oss、Qwen、Gemma 等主流开源模型。
安装与首次运行
macOS 与 Linux:
curl -fsSL https://ollama.com/install.sh | sh
Windows PowerShell:
irm https://ollama.com/install.ps1 | iex
也可以用官方 Docker 镜像 ollama/ollama 运行。
REST API 与客户端库
Ollama 内置 REST API,默认监听本地 11434 端口,/api/chat 用于对话请求:
curl http://localhost:11434/api/chat -d '{
"model": "gemma4",
"messages": [{"role": "user", "content": "Why is the sky blue?"}],
"stream": false
}'
完整端点清单见 docs.ollama.com/api。官方同时提供 Python(pip install ollama)与 JavaScript(npm i ollama)客户端。
接入编码 Agent
ollama launch 可以把本地模型注册给编码工具作为后端。官方列出的集成包括 Claude Code、Codex、Copilot CLI、DeepSeek Harness、Droid 与 OpenCode:
ollama launch claude
ollama launch openclaw 则把 Ollama 变成跨 WhatsApp、Telegram、Slack、Discord 的个人 AI 助手后端。模型权重驻留本机,由编码工具通过 Ollama 在本地调用。
模型定制与导入
用 Modelfile 可以定制模型:改系统提示、调温度参数、固化对话模板,再用 ollama create 生成自定义模型。已有其他格式的模型也可按官方文档导入,不是必须在模型库中选取。
生态现状
聊天界面方面,Open WebUI、Onyx、LibreChat、Lobe Chat、NextChat、Perplexica 等原生支持 Ollama 接入;开发框架方面,LiteLLM、LangChain、LlamaIndex、Haystack 等都有对应集成。仓库现有 610 名贡献者、247 个 release。
结论
本地运行大模型,Ollama 把安装、拉模型、对话、API 与 Agent 接入收敛进几条命令,官方集成清单与周边项目覆盖面广,适合个人开发者与数据不出本机的小团队。
如果只记一句话:Ollama 的核心价值,是把本地大模型的安装、运行与接入收敛成一条命令,端到端跑通。