AI 科学家能独立开展研究了吗?

基于 2026 年证据,评估 AI 科学家的基准差距、可复现性限制,以及人类研究者目前仍承担的作用。

发布: 2026年8月20日8 分钟阅读

AI 科学家能独立开展研究吗?

2025 年,一篇由自主科研系统生成的论文通过了 ICLR Workshop 的同行评审。这个里程碑说明,AI 科学家工作流已经能够完成一轮研究流程,但它并不能证明系统已经可以可靠、独立地开展科学研究。2026 年的证据支持一个更克制的结论:端到端自动化已经成为现实,但可复现的独立研究仍然需要人类判断。

“端到端”究竟意味着什么

AI 科学家工作流可以提出想法、编写代码、运行计算实验、分析结果、起草论文,并审阅自己的工作。Sakana AI 的 AI Scientist-v2 在没有人类编写实验模板的情况下完成了这些步骤,其中一篇论文被 Workshop 接收。

完成所有阶段是一项工程成就;正确、稳定地完成每个阶段,并留下可供其他研究者检查的证据,才是科学标准。这是两个不同的命题。

证据令人印象深刻,但得分大约只有专家的一半

端到端评测最能体现这一差距。Stanford HAI《2026 AI Index》科学章节显示,PaperArena 中表现最好的智能体得分为 38.8%,而博士专家为 83.5%,前者大约只有专家参考分数的一半。在 ReplicationBench 上,前沿模型完成的论文级天体物理复现任务不足 20%。ChemBench 也呈现出类似的复杂局面:领先模型在 2,700 多道化学问题上的表现超过普通人类平均水平,却仍会犯基础错误。

AI 科研智能体与博士专家在 PaperArena 上的得分差距

图 1. 即使模型在单项任务上持续进步,端到端科研表现仍明显低于专家参考分数。

这个规律很重要。AI 系统可能擅长文献检索、代码生成和数据分析,却不擅长把这些步骤协调成一项正确、留下可审计记录并且可以复现的研究。

最有力的 AI 科学家成果仍然离不开研究者

近期的成功案例更像协作,而不是人类已经退出科研闭环的证据。FutureHouse 的 Robin 检索文献、提出候选分子,并为干性年龄相关性黄斑变性选择实验方案;人类研究者负责开展实验并返回结果。据 Nature 报道,团队估计这种协作将项目周期缩短了约 200 倍。

Google 的 AI Co-Scientist 与科学家一起在三个生物医学方向接受评估,包括急性髓系白血病的药物再利用、肝纤维化靶点和一种抗菌药物耐药机制。研究报告了独立的体外验证,专家参与了问题设定、过程指导和结果检查。

人在回路的 AI 科研工作流

图 2. 当前高价值系统采用分工式闭环:AI 扩展搜索和生成能力;研究者设定问题、完成关键实验并判断证据。

因此,真正有用的问题不是 AI 能否生成一个看似合理的靶点,而是其中的假设、证据、方法和实验决策是否足够清晰,让研究者能够提出质疑。

真正的瓶颈:可复现性与可审计性

独立研究不能只有一份精美的结果。计算步骤应记录代码、数据、参数、运行环境和溯源信息,使其他研究者能够重建发生过什么。随机实验或物理实验不一定能逐位复现,但方法和不确定性仍需要被充分记录,才能接受独立检验。

可复现 AI 辅助研究的审计轨迹与受控执行支柱

图 3. 审计轨迹和受控执行为可复现性提供支持;科学有效性仍取决于对证据和方法的审查。

ReplicationBench 的低完成率不能证明所有失败都来自同一个架构缺陷,但它说明,仅仅擅长回答问题还不够:科研系统必须协调长链条执行,并保留评估这些步骤所需的完整记录。

常见误解

  1. “它写出了一篇论文,所以可以独立做研究。” Workshop 接收说明工作流可以生成可供评审的论文,但不能证明研究结果能够复现。
  2. “问答基准已经给出了答案。” 单个问题的回答与论文级执行考查的是不同能力。
  3. “人类只会拖慢闭环。” 在最有力的生物医学案例中,人类对问题的设定、实验和验证正是结果可信的一部分。

常见问题

AI 科学家能在没有人类参与的情况下开展研究吗? 目前还不能做到可靠研究。端到端系统已经存在,但当前论文级和端到端评测仍明显落后于专家表现,经过验证的实验室结果也仍然有研究者参与。

回答科学问题与开展研究有什么区别? 科学问答测试的是孤立回答;研究则需要连接假设、方法、执行、分析和复现,并用证据支撑每一次转换。

AI 已经能在哪些科研环节发挥作用? AI 可以加快文献检索、候选生成、代码编写、数据分析和论文起草。研究者仍然负责问题设定、关键实验和最终解释。

怎样才能让 AI 研究更加独立? 提升端到端可靠性、可复现执行、可检查的溯源能力和稳健验证,可以减少每个阶段所需的监督。

团队应该如何评估 AI 科研平台? 先检查平台是否支持项目连续性和论文复现工作流,再测试它能否保存验证结果所需的来源、设置、中间结果和失败记录。

延伸阅读:可复现研究:弥合科学 AI 的执行鸿沟讨论科研执行标准,材料科学 AI则展示生成、模拟和实验如何组成可检验的闭环。

我们应该如何看待当前进展

AI 科学家现在已经能够完成具有研究形态的工作流,但在可靠的科学实践中,“独立”仍然是过强的描述。现实机会在于协作:让 AI 压缩检索、起草、编程和迭代所需的时间,同时由研究者定义问题并验证证据链。

Mira Science: 官网将 Mira 称为 AI Scientist Mira,并将其定位为 AI Research Partner;官网还把论文复现列为核心工作流之一,并表示项目经验会随着工作推进沉淀到平台中。可以从一个边界清晰的任务开始,按照自己的验证标准评估这套工作流。开始使用 Mira 开展研究 →