可复现研究:弥合科学 AI 的执行鸿沟
为什么可复现研究不只是基准准确率:从论文级复现到可追踪、可重复的科学 AI 工作流。

可复现研究是科学 AI 尚未稳定跨越的门槛。一个模型可以在数千道问题上超过普通人类化学家的平均表现,但前沿系统完成的论文级天体物理复现任务仍不足 20%。因此,真正有用的指标不是答案听起来是否正确,而是另一位研究者能否检查方法、重新运行计算工作并检验结论。
AI 进入科学的速度快于可复现实践
AI 在科学中的应用早已不是边缘现象。Stanford HAI《2026 AI Index》科学章节显示,2025 年与 AI 相关的自然科学论文约有 80,150 篇,比 2024 年增长 26%。根据学科不同,AI 估计出现在 5.8%–8.8% 的研究产出中,而 2010 年这一比例还不到 1%。
这种增长进入了本就面临复现失败问题的学科。AI 又增加了一种新的失败方式:结果表达流畅,但运行环境、参数、中间决策或数据来源链无法重建。引用并不存在时,幻觉很容易被发现;不可复现的执行却更难察觉,因为最终图表完全可能看起来合情合理。
基准表现强,论文级执行弱
同一份 Stanford HAI 证据把这种分化展示得很具体:
- 在 ReplicationBench 上,前沿模型完成的论文级天体物理复现任务不足 20%。
- 在 PaperArena 上,表现最好的智能体得分为 38.8%,博士专家为 83.5%。
- 在 ChemBench 上,领先模型在 2,700 多道问题上的表现超过普通人类平均水平,却仍会在基础任务中失败。

图 1. 单个问题上的强表现不会自动迁移到长链条、论文级的执行任务。
ReplicationBench 考查的不只是知识回忆:系统必须理解论文、重建方法、执行工作流,并判断结果是否一致。每一次步骤交接都可能造成不易察觉的偏移。
人在回路的成果展示了当前可行模式
自主计算工作流正在进步。Sakana AI 的 AI Scientist-v2 在没有人类编写实验模板的情况下生成想法、编写代码、运行计算实验、分析结果并起草论文,其中一篇论文被 ICLR Workshop 接收。
实验室验证仍然呈现出更强的协作特征。FutureHouse 的 Robin 为干性年龄相关性黄斑变性提出候选分子和实验方案,人类完成实验并把结果反馈给系统。据 Nature 报道,团队估计项目周期缩短了约 200 倍。Google 的 AI Co-Scientist 则在专家指导下,跨三个生物医学领域接受了独立体外评估。
这些系统提供了速度和广度;研究者负责实验执行、领域判断和结果验证。这种分工不是需要隐藏的限制,而是当前可复现的运行模式。
可复现研究是一套执行规范
可复现研究并不总意味着逐位重放。对于确定性计算阶段,精确重放可能是有价值的目标。对于随机模型、不同硬件或物理实验,团队也可以要求完整记录实验条件和不确定性范围,并确保独立运行仍得到实质一致的结果。
一套可复现的 AI 辅助研究工作流应保存:
- 研究问题、验收标准和方法;
- 源数据与溯源信息;
- 代码、模型、环境、参数,以及适用时的随机种子;
- 中间输出、失败记录和人类干预;
- 能够区分“执行成功”与“科学结论得到支持”的评估。

图 2. 可复现性需要从问题到证据的整条链路中设计进去,而不是最后勾选的一项检查。
可审计性是可复现性的补充。如果输入、决策和不确定性保持可见,一套工作流即使每次运行有所差异,也仍然可以接受科学评估。反过来,一个确定性脚本也可能永远重复同一个错误假设。团队既需要受控执行,也需要批判性审查。
常见误解
- “基准答案正确就意味着研究可复现。” 科学问答与链式执行考查的是不同能力。
- “可复现意味着每次输出必须完全相同。” 在可行情况下,精确重放很有价值;但科学可复现性也可以指在公开条件和容差下得到一致结论。
- “一份看似合理的报告已经足够。” 语言质量不能证明数据来源链、方法忠实度或实验有效性。
- “可复现性可以在最后补上。” 缺失的溯源信息和未记录的决策无法在运行结束后被可靠重建。
常见问题
科学 AI 的可复现性鸿沟是什么? 它指的是系统在孤立科学问题上表现很强,但在需要重建、执行并验证已发表研究的完整工作流上表现较弱的差距。
为什么模型在基准上表现很好,却难以复现论文? 论文复现连接了许多相互依赖的阶段。即使每个回答单独看都很合理,理解、实现、环境、执行或评估中的错误仍可能不断累积。
可复现性是否要求输出完全相同? 不一定。精确重放适用于确定性计算;对于随机过程和物理实验,只要方法、条件、不确定性和实质结论可以接受独立检验,也可以构成可复现研究。
可复现 AI 工作流应该记录什么? 它应记录来源、代码、环境、参数、中间输出、失败、人类干预,以及用于支持结论的评估方法。
完全自主的系统已经能够开展可复现研究了吗? 自主计算工作流已经可以完成端到端演示,但验证最充分的实验室成果仍然结合了 AI 生成、人类实验和人工审查。
延伸阅读:AI 科学家能独立开展研究了吗?区分端到端自动化与独立研究,材料科学 AI则把可复现性问题落到计算与实验工作流中。
结论
可复现研究不是表面规范。它区分了一个有用答案和一项其他研究者能够评估的科学结果。团队应该用经得起审查的内容来衡量 AI 科研系统:记录完整的方法、可恢复的产物、受控执行、明确的不确定性,以及能够支持结论的证据。
Mira Science: Agent Mira 将论文复现列为核心工作流,并表示项目经验可以随着时间沉淀到平台中。可以选择一篇边界明确的论文,按照自己的可复现性检查清单进行评估。开始使用 Mira 开展研究 →

