hyperresearch 是一个开源框架,用来把 Claude Code 变成「深度研究 Agent」。Claude Code 是 Anthropic 出品的命令行编程助手——你在终端里用自然语言让它写代码、改代码的那种工具。hyperresearch 给它加了一条 16 步的自动化研究流水线:你输入一个问题,它自动查资料、找矛盾、写草稿、审查、改稿、核查引用,最终产出一份逐条标明来源的研究报告。项目作者是 jordan-gibbs,GitHub 星标约 2.2k、被 Fork 239 次,使用 MIT 许可证,代码基于 Python(支持 3.11–3.13 版本)。
这里说的 Agent,可以理解为「能自己拆任务、按步骤执行的 AI 助手」;流水线则是把研究拆成固定步骤、一步接一步执行的过程。
它解决的是深度研究最头疼的两个问题。一是出处不可信:普通 AI 问答经常给结论不给来源,甚至编造文献。二是过程不可复查:报告是怎么写出来的、哪一步出了问题,用户无从知晓。hyperresearch 把「一次回答」变成「一条可追踪的流水线」,每一步都有记录,跑崩了还能从断点续跑。
适合用它的人:需要撰写长报告的研究者、开发者、分析师,以及一切「不满足于 AI 随口一答、要求每个结论都有据可查」的用户。前提是你已经在用 Claude Code——它不是一个独立的问答网站。
16 步流水线怎么跑
这 16 步大体分四段。第一段是拆解与采集:把提问拆成原子问题,多角度搜索,批量抓取网页,并对抓到的资料做冲突检测——把相互矛盾的说法聚类,留给后续重点调查。第二段是深入调查:对重点问题并行深挖,固定各方立场,梳理专家分歧。第三段是写作与对抗:并行写三份草稿,再由综合器合并成最终报告。第四段是审查与交付:四个批评者并行挑错,随后补抓缺失资料、做外科手术式的定点修改,最后逐条核查引用与句子的对应关系,再润色、做可读性审计。
对抗式审查:先假设报告是错的
hyperresearch 的审查设计值得单独说。四个批评者并行攻击草稿:分别找「遗漏的反面证据」「浅层分析的漏洞」「被忽略的角度」「与提问要求不符的结构」。负责修改的 patcher(修补器)被工具锁定,只能做「读 + 定点编辑」,物理上无法整篇重写——批评意见只能以小块修改落地。每条引用在交付前都要核查:引用的那段话必须真的存在于原文笔记中;引用已撤稿来源而不加说明会被直接拦截(撤稿指论文因错误或学术不端被期刊正式收回)。
三档规模:从半小时速查到八小时长文
流水线按问题难度分三档。light 档适合事实查询类问题,只跑核心步骤,约 30–40 分钟。full 档(默认)跑完全部 16 步,约 1.5–2.5 小时,基准抓取 55–80 个来源;调高档位到 premier 单次可读 250+ 来源。dissertation 档面向长篇写作:4–10 章、300–450 个来源、2.5 万–8 万字,耗时 4–8 小时。每档都能设定预算上限,超出即暂停,而不是让费用悄悄失控。
每个来源都进知识库
大多数研究工具是「一次性」的:报告交出去,资料就扔了。hyperresearch 把每次读过的来源都存进一个持久化知识库:正文以 Markdown 存放,SQLite(一种轻量嵌入式数据库)负责索引检索;下次运行先搜旧库,命中就不重复抓取。它还支持语义搜索——按「含义相似」而非「字面相同」来检索,默认方案不需要任何 API 密钥。知识库通过 MCP 服务器暴露给其它 AI 客户端(MCP 是 AI 工具之间的标准接入协议,提供 13 个工具),也自带一个本地 Web 界面(默认 8080 端口)。也就是说,你的研究会不断累积,而不是每次从零开始。
边界:它不做什么
hyperresearch 明确不做三件事。第一,不替你做判断:哪些来源重要,仍由你决定,它只负责执行。第二,不自动破解登录:LinkedIn、Twitter 或付费墙后的内容,需要你登录自己的浏览器授权抓取,验证码和两步验证永远不会被自动绕过。第三,不保证事实绝对正确:它保证的是流程完整——引用有出处、撤稿被拦截、数字可追溯,但研究结论的对错最终仍由你判断。另外需要留意:README 中「在 DeepResearch-Bench RACE 排行榜领先」的说法目前是项目方内部基准,第三方验证尚未完成。
结论
hyperresearch 把「AI 深度研究」从一句无法核验的回答,变成一条每步可查、引用必验的 16 步流水线,并让研究资料持续累积。 如果你写报告时需要 AI 帮忙,又受不了没有出处的答案,这个项目值得一试——前提是你已经在用 Claude Code。