一个名为 kimi-k3-in-c 的开源项目,实现了这样一件事:把总参数 2.78 万亿的 Kimi K3 大模型,跑在一台只有 8GB 内存、没有独立显卡的普通电脑上。它不用 GPU(图形处理器)、不依赖任何现成的 AI 框架,整个推理引擎的二进制只有 176KB,代码以 Apache-2.0 协议开源,2026 年 8 月发布 v1.0.0,目前在 GitHub 上已获得 6.5k star。

它是什么:一个用 C99 语言从零写成的模型推理引擎——推理引擎就是专门负责让模型「运行起来、输出文字」的那部分程序。 它解决什么问题:大模型通常需要巨大的显存和内存才能运行,普通电脑根本装不下;这个项目用一系列压缩与流式读取技术,让超大模型也能在只有 8GB 内存的电脑上跑起来,代价是速度慢一些。 适合谁用:没有 GPU 又想本地运行超大模型的开发者、研究模型推理优化的工程师,以及对大模型内部原理好奇的技术爱好者。

为什么 2.78 万亿参数的模型很难跑

参数(parameter)是模型里可调节的数字,可以粗略理解为模型的「知识储量」:参数越多,模型通常越强,但也越占地方。Kimi K3 有 2.78 万亿参数,按 bfloat16 精度(一种省内存的数字存储格式)存放需要约 5.56TB 内存——而一台普通电脑的内存只有 8GB 到 32GB。

官方发布的模型文件(checkpoint,即训练完成后保存下来的整套权重)压缩后也有 1.56TB。光是「把模型装进内存」这一步,就拦住了几乎所有个人设备。

MoE 结构:每次只调动 3.7% 的参数

Kimi K3 采用 MoE(Mixture of Experts,混合专家)结构:模型内部有 896 个「专家」子网络,处理每个词时只挑选 16 个最相关的参与计算,相当于每次只激活约 3.7% 的参数(约 1040 亿个)。这就像一家大公司接到任务,只派相关部门的少数人干活,而不是全员出动。

但问题在于:其余 96% 的专家虽然暂时不参与计算,仍然必须存放在某个地方。kimi-k3-in-c 的回答是——放在硬盘上,需要谁就读谁。这正是整个项目能成立的关键。

四项减重设计

第一,专家权重按 4bit 打包。 约 1.45TB 的专家参数以紧凑格式存放,从不整体载入内存,计算时直接从硬盘读出参与运算。

第二,KDA 注意力机制。 一种内存占用不随对话长度增长的计算方式,避免长对话把内存吃光。

第三,MLA 注意力。 用单个 latent(潜变量,一种压缩后的中间表示)替代传统方案中的 96 个注意力头(attention head,模型关注文本不同位置的机制),大幅减少中间数据。

第四,模型主干流式化。 约 113GB 的模型主干按需从硬盘流式读入内存,内存需求从「必须全部装下」变成「可以调节」:8GB 能跑,128GB 跑得更快,输出结果完全一致。

实测速度:内存只买速度,不换答案

项目公布的实测数据(完整记录在仓库 docs/data 目录):

  • 8GB 内存的普通笔记本:每个 token 约 26.5 秒。token 是模型处理文本的最小单位,大致相当于一个词的片段。
  • 32GB 高端笔记本:约 24.2 秒/token。
  • 64GB 台式机:约 19.8 秒/token。
  • 128GB 以上工作站:约 5.6 秒/token。

同一模型、同一提问,从 8GB 到 224GB 内存的机器,输出逐字节一致(byte-identical)。更多的内存只带来更快的速度,不会改变答案本身。 速度的瓶颈主要在硬盘读取,而不是 CPU 计算。

代价与限制

这个项目的门槛并不低,如实列出:

  • 需要约 1.7TB 空闲硬盘:模型文件 1.56TB(96 个分片)加上打包后的模型主干 109GB,且强烈建议放在 SSD/NVMe 上,机械硬盘会慢得多。
  • 速度确实慢:8GB 配置下每生成一个 token 要等约 26 秒,生成一段话需要数分钟;想要接近可用的速度,需要 128GB 内存以上的工作站。
  • 平台约束:引擎目前面向 Linux x86-64 系统,CPU 需支持 AVX2 指令集(近十年的桌面 CPU 基本都支持);macOS 与 Windows 上只有分词器等外围组件可以移植。
  • 下载成本:模型需要从 HuggingFace 下载 1.56TB 数据,耗时数小时。

如何证明计算没出错

没有框架、没有 GPU,纯手写 C 代码跑万亿参数模型,凭什么相信它算对了?项目内置了完整的验证流程:先在小模型上运行测试套件,再与 13 层参考模型的 PyTorch(一个主流深度学习框架)实现逐 token 对照,最后在完整的 93 层模型上验证生成的每个 token 与参考输出完全一致。全部测试数据都提交在仓库中,可以自行复现。

适合谁用

符合下面任意一条,这个项目值得一试:

  • 没有 GPU,但想在本地运行超大模型、体验模型在自己机器上跑起来的开发者;
  • 想研究 MoE 推理优化、内存受限推理方案的技术工程师;
  • 对「大模型到底是怎么跑起来的」好奇、愿意花时间读文档和源码的学习者。

它不适合追求快速流畅对话体验的用户——在普通配置上,等待一个回答的时间要以分钟计。

结论

内存不够不是墙,只是慢。kimi-k3-in-c 用纯 C 代码证明了 2.78 万亿参数模型在 8GB 内存上确实能跑,代价是每个 token 等约 26 秒;内存加到 128GB,输出一字不变,速度提升近 5 倍。对没有 GPU 却想亲手上手超大模型的人来说,这是目前少有的、能在自家电脑上运行的选择。