Ollama 是一个让你在自己电脑上运行大模型的开源工具。 大语言模型(LLM)就是 ChatGPT 背后那类 AI——能理解文字、写代码、回答问题;而 Ollama 做的事,是把这类模型下载到你的本机运行,数据不出电脑,也不需要为每次调用向云端付费。2026 年 7 月,Ollama 官方宣布已服务 890 万开发者,并完成 8800 万美元融资;8 月底又推出按 token 计费的 Pro、Max、Team 商业套餐。它正在从纯免费开源工具,走向「免费 + 付费」的商业化阶段。

Ollama 是什么

Ollama 属于「大模型运行时」这类工具,负责把开源模型(如 Meta 的 Llama、阿里的 Qwen、谷歌的 Gemma)安装到你的电脑上,并提供命令行和 API 方便调用。对开发者来说,它的核心价值是一个命令就能把模型跑起来,省去配置显卡驱动、Python 环境和依赖库的繁琐步骤。

适合用它的人主要有三类:在意隐私、不愿把数据发给云端的用户;需要在离线或内网环境使用模型的人;以及想省下 API 费用、且自己机器带动得动的开发者。它支持 Windows、macOS、Linux,苹果芯片和 NVIDIA、AMD 显卡都能加速。

苹果芯片上的加速:MLX 引擎

2026 年 Ollama 的重点之一是 Apple Silicon(苹果自研芯片,Mac 电脑搭载)上的性能。它接入苹果开源的 MLX 机器学习框架,让模型在这类芯片上跑得更快。官方数据:6 月底发布的 Ollama 0.31,通过多 token 预测(MTP,一次预测多个后续 token 的加速技术)让 Gemma 4 在编程场景下最快提速 90%(Aider 编程基准测试)。6 月初的 0.30 版本还通过 llama.cpp 改善了 GGUF 格式兼容——GGUF 是社区通用的模型打包格式,兼容性提升意味着更多模型能在更广泛的硬件上运行。

模型库扩大:从 Nemotron 到 Muse Glimmer

8 月 Ollama 新增两款值得注意的模型。NVIDIA 的 Nemotron 3.5 Lightning(8 月 11 日上线):300 亿参数的开源模型(参数是模型的内部规模,通常越多越聪明、也越吃算力;运行时常驻 30 亿参数),面向 AI 代理(agent,能自主调用工具、分多步完成任务的 AI 程序)场景,适合长期驻留、持续收集上下文并调用工具的用途。Meta Superintelligence Labs 的 Muse Glimmer(8 月 10 日上线):该实验室首个开源模型,300 亿参数、支持图文多模态(能同时处理文字和图片)、Apache 2.0 许可(宽松的开源协议,可自由使用与修改),由 MLX 引擎加速并支持图像输入。加上此前已入库的 gpt-oss、Qwen3-VL、MiniMax M2 等,Ollama 的模型库已覆盖主流开源模型。

商业化落地:按 token 付费与融资 8800 万美元

8 月 31 日,Ollama 宣布 Pro、Max、Team 三档套餐改用行业标准的按 token 计费(token 是模型处理文本的最小单位,大致相当于一个汉字或半个英文单词),且每档套餐都包含用量。这意味着面向团队和重度用户的收费层正式落地;本地运行开源模型依然是免费的基本盘,收费层面向需要更多算力与团队管理的用户。

融资方面,7 月 9 日 Ollama 宣布服务开发者数达到 890 万,并完成 8800 万美元融资,投资方包括 Benchmark、Theory Ventures、8VC、Y Combinator 和多位天使投资人。资本进入与商业化同步推进,说明这个项目进入规模化运营阶段。

生态集成:从 Claude Desktop 到 ollama launch

8 月 25 日,Claude Desktop 支持把 Ollama 配置为第三方网关——网关是转发模型请求的中转服务,配置后可以在 Claude 的界面里使用本地开源模型。此外,1 月上线的 ollama launch 命令可以一键搭好 Claude Code、OpenCode、Codex 等编程工具的运行环境,无需配置环境变量;OpenJarvis 这类本地优先的个人 AI 框架也内置了 Ollama 支持。Ollama 正在成为本地大模型生态的公共入口。

对使用者的意义

如果你想要一个在本地跑开源模型的简单入口,Ollama 是目前最省事的选择:安装后一条命令拉模型、一条命令运行,隐私和费用都握在自己手里。2026 年的变化说明两件事:苹果芯片用户会获得越来越好的本地推理体验;这个生态正在长出付费层——免费本地运行仍是基本盘,商业化主要面向团队和企业用量。