AI for Science 的第五范式:从数据分析走向科研智能

AI for Science 如何从数据分析走向生成、验证与迭代闭环,以及为什么第五范式仍是一项设计命题。

发布: 2026年8月20日8 分钟阅读

AI for Science 的第五范式

人们经常用“第五范式”讨论 AI for Science:这是一种分析科学实践可能如何变化的框架,其中 AI 从分析工具进一步进入“生成—验证—迭代”闭环。它并不是已经确立的科学史定律,这场转变也尚未完成。这个命题值得研究,是因为越来越多的系统已经可以提出候选、设计工作流,并把计算生成与物理验证连接起来。

从观察走向科研闭环

一种常见的科学发展叙事从经验观察开始,随后进入理论、计算和数据密集型发现。Jim Gray 在 The Fourth Paradigm 中推广了“第四范式”这一说法,用来描述围绕大规模数据和计算组织起来的科学研究。

被提出的第五阶段再次改变了机器的角色。AI for Science 系统不再只从已有数据中寻找规律,而是参与决定下一步应该生成、模拟或检验什么。这并不是一条整齐的历史分界线——现代研究会同时组合五种模式——但它可以帮助我们明确新基础设施需要承担什么职责。

AI for Science 中的生成、验证与迭代闭环

图 1. 被提出的第五范式增加了一条有记录的“生成—验证—迭代”闭环,但不会取代观察、理论、计算或数据密集型科学。

AI for Science 的论文规模正在快速增长。Stanford HAI《2026 AI Index》科学章节估计,2025 年与 AI 相关的自然科学论文约有 80,150 篇,比 2024 年增长 26%。AI 约占各领域研究产出的 5.8%–8.8%,而 2010 年还不到 1%。论文数量本身不能证明一种新范式已经形成,但它提供了足以孕育新工作流的规模。

怎样才能让这一框架真正成立?

第五范式工作流不能只加快分析,还需要连接四项功能:

  1. 生成候选或假设;
  2. 通过模拟或实验进行评估;
  3. 保存证据、参数和结果;
  4. 利用结果决定下一轮迭代。

因此,最重要的产物不是一次预测,而是一条科研闭环:其中的提案要接受约束,失败也能改善下一次决策。本文所说的“科研智能”指的正是这种可追责闭环,不能把它与未经验证的生成结果混为一谈。

AI for Science 转变的三个信号

生成式材料设计

MatterGen 原始论文介绍了一种扩散模型,它通过联合建模原子类型、坐标和晶格结构来生成无机材料。这是一种逆向设计:从目标性质出发提出候选结构,而不是只对固定目录进行评分。

GNoME 展示了规模,但它并不是同一种生成路径。GNoME 的 Nature 论文报告了超过 220 万个计算发现的结构,其中 381,000 个条目被加入更新后的凸包。作者还找到了 736 个预测结构,它们已经在同期的外部工作中被独立实验实现。这些匹配验证了部分预测空间,但它们并不是 GNoME 促使实验室合成出来的材料。

自动化物理实验室

A-Lab 提供了另一个信号:一个结合文献合成方案、机器学习、机器人和表征设备的物理实验室。在 A-Lab 的 Nature 论文中,系统在 17 天内尝试了 57 个目标并合成了 36 个。目标集合由人类研究者选择并初始化,因此这项结果展示的是高度实验室自动化,而不是不需要人类的发现过程。

AI for Science 的干湿实验闭环

图 2. 干湿实验闭环将计算生成与物理验证相连,再把实验证据带回下一轮迭代。

具有科研形态的软件系统

Sakana AI 的 AI Scientist-v2 在没有人类编写实验模板的情况下生成想法、编写代码、运行计算实验、分析结果并起草论文,其中一篇论文被 ICLR Workshop 接收。Google 的 AI Co-Scientist生成并排序生物医学假设,科学家随后在三个领域进行评估。

这些案例共同说明,科研闭环的若干组成部分已经存在,但不能证明一个自主系统已经能够可靠地整合所有环节。

验证仍然是闭环最容易断裂的地方

端到端评测揭示了当前限制。在 Stanford HAI 的 2026 年证据中,前沿模型在 ReplicationBench 上完成的论文级天体物理复现任务不足 20%。PaperArena 中表现最好的智能体得分为 38.8%,博士专家为 83.5%。

对 AI for Science 而言,生成可以扩大搜索空间,因此很有价值;但科学进展仍然取决于模拟、实验和专家审查能否淘汰错误候选,以及系统能否保留足够的上下文,从失败中学习。Workshop 接收的论文与物理实验室提供的是不同类型的证据,不能被压缩成同一个自主性结论。

如何看待“第五范式”命题

更合适的做法是把第五范式视为一项设计命题。它的组成部分确实存在:生成模型、自动化实验室、假设系统和科研写作工作流;但要把它们可靠地整合成可复现系统,仍然是工程与科学挑战。

延伸阅读:可复现研究:弥合科学 AI 的执行鸿沟讨论执行门槛,材料科学 AI则分析这条闭环最具体的应用领域。

Mira Science: 官网将 Mira 称为 AI Scientist Mira,并将其描述为 AI Research Partner;官网还把论文复现列为核心工作流,并表示项目经验可以沉淀到平台中。这种以项目为中心的方法,为检验第五范式框架提供了一种路径,同时避免把生成答案误认为已经验证的研究。开始使用 Mira 开展研究 →

真正的问题不是“第五范式”这个标签是否已经胜出,而是团队能否构建这样的闭环:生成始终对证据、验证和人类判断负责。