Academic Research Skills:AI 学术写作管线的引文查证与完整性门禁

AI 写论文的真正风险不是"写得不像人",而是"自信地编造":虚构一篇不存在的文献,或引一篇真实文献却支撑不了自己的主张。这类错误在 2026 年的论文里已有规模化证据——一项覆盖 111M 条参考文献、2.5M 篇论文的审计估计,仅 2025 年就新增约 14.7 万条幻觉引用(Zhao et al.,2026)。开源项目 Academic Research Skills(ARS)给出的应对方式不是让 AI 写得更"像人",而是把查证与审计做成不可跳过的工程门禁。

ARS 是面向 Claude Code 的学术研究技能套件,GitHub 上 43.7k star、3.5k fork,最新 v3.21.1(2026-08-24 发布),遵循 CC BY-NC 4.0 协议。它用四条 Skill 覆盖从选题到投稿的全流程:Deep Research(13 个智能体的研究团队)、Academic Paper(12 个智能体的写作管线)、Academic Paper Reviewer(7 个智能体的多视角评审面板)、Academic Pipeline(10 阶段编排器)。

核心立场一句话:AI 是副驾驶,不是飞行员——查证、排版、一致性检查交给 AI,问题定义、方法选择、结论解读留给研究者。

四条 Skill 各管一段

Deep Research 负责把模糊想法收敛成研究问题:8 种模式覆盖全文研究、快速简报、PRISMA 系统综述、苏格拉底式引导、事实核查、文献综述、三向对比与质量评审。苏格拉底引导模式内置意图检测——对话开始及每 3 轮分类一次"你在探索还是在要结果"——探索模式禁用自动收束并允许最多 60 轮追问,避免 AI 过早结束追问、直接给出结论。

Academic Paper 负责写作:12 个智能体的管线、11 种模式,输出 APA 7.0(含中文引文规则)、IEEE、Chicago、MLA、Vancouver 等格式,可生成 Markdown、DOCX 与 LaTeX 并编译 PDF。它带有风格校准(从你过去的作品学习文风)、写作质量检查(识别机器味太重的句式)、视觉模型校验图表(VLM figure verification,核对插图与正文表述是否一致)与反泄漏协议。

Academic Paper Reviewer 负责投稿前自查:期刊匹配评审、3 个动态评审与 Devil's Advocate 组成的 7 智能体面板,按既定标准给出基于证据的分段评判,而不是一个笼统分数。评审遵循只读约束——不直接改稿,只产出批评。

Academic Pipeline 把前三段串成 10 阶段流水线,最重要的设计是 Stage 2.5 / Stage 4.5 两道完整性门禁,强制不可跳过——任何覆盖都必须记录用户理由。项目自带的真实运行产物显示,Stage 2.5 曾一次抓到 15 条虚构引用与 3 处统计错误,Stage 4.5 确认零回归。流水线结束时生成过程总结,给出 6 维度的协作质量评分。

查证与审计:把"引用幻觉"变成可拦截项

ARS 处理引文是确定性的,不依赖评审模型"碰巧看出问题"。

  • 四索引引文存在性校验(v3.11 引入):每条引用自动向 Semantic Scholar、OpenAlex、Crossref、arXiv 四个文献库查证(arXiv 解析器无需 API key),产出三个状态之一:lookup_verified: true / false / unresolvable。构造一个假 DOI 或 arXiv ID,会在这道查证里直接暴露,而不是指望审稿人发现。查证结果写入本地 SQLite 缓存(90 天 TTL);strict 策略下,查证失败的引用可以做成终端拦截。
  • 三层引用锚点 + 声明审计(v3.7.3 起):每条引用携带定位锚点;v3.8 起可开启 ARS_CLAIM_AUDIT=1 审计通道,拉取被引文献内容,对照锚点判断"这条主张是否真的被该引用支持",输出 claim-not-supported(主张无支撑)、fabricated-reference(引用为虚构)等五类高警告,经格式化终端硬门禁拦截。校准集 20 条,接受阈值 FNR<0.15(假阴性率)、FPR<0.10(假阳性率)。
  • 实验溯源清单(#260):声明涉及实验的论文,必须在 Material Passport(实验来源登记表)上登记实验出处(实验 ID、计划与执行对照、负面结果、已知局限);完整性门禁按 ALIGNED(一致)/ OVERSTATED(夸大)/ NOT_SUPPORTED_BY_PROVENANCE(出处不支持)/ PROVENANCE_INSUFFICIENT(出处不足)逐条审计。没跑实验也必须显式声明"无实验",杜绝静默跳过。

反谄媚与跨模型复核:抵制 AI 的过早让步

AI 在质疑面前容易过快让步——这是训练目标(追求对话和谐)的副作用。ARS 为此给 Devil's Advocate 加了让步阈值协议:每次回应前先给反驳打分(1-5),只有达到 4 分及以上(反驳直接命中核心攻击且带证据)才允许让步;低于 4 分则坚守立场并重申原攻击。同时禁止连续让步、追踪让步率、在每个检查点检测 frame-lock(AI 困在自己设定的框架里自我循环),阻断 AI 在用户施压下改口的路径。

苏格拉底导师还内置对话健康监测:每 5 轮静默自评一次"持续附和 / 冲突回避 / 提前收敛",发现附和模式就自动注入挑战性问题。另外可开启跨模型复核(ARS_CROSS_MODEL),由不同模型对审计结论做独立再判。

上手与成本

安装是标准 Claude Code 插件流程,两步命令、30 秒完成;也可以用 /ars-plan 与苏格拉底对话描述论文,由套件规划章节结构。按官方性能文档,跑完一整篇约 1.5 万字论文的全流程,花费约 $4–6。

界面语言随输入自动切换,默认支持英文与繁体中文,可生成双语摘要。协议是 CC BY-NC 4.0——免费但禁止商用。

边界:门禁挡不住刻意造假

ARS 自己写明了两条边界:它不替你运行实验,也不验证原始数据的真实性——一套前后一致的编造,可能通过全部检查。完整性校验覆盖"程序是否被执行、声明与出处是否对齐",不覆盖"实验本身是否正确"。可靠性的最后一道闸始终在人手里。

对想用 AI 加速学术写作的开发者与研究者,ARS 的价值是把虚假引用与过度声称这类事故的成本,从"发表后被追责"前置到"提交前拦截"。这种把引文查证、声明审计、强制门禁与开源可自查做进同一闭环的做法,在当前开源生态里还比较少见。