通讯作者

张悦:zhangyue@westlake.edu.cn

[无标题图片]

人工智能科学家距离改变世界还有多远 ?

谢秋杰* 1,2翁逸轩* 1朱敏君* 1,2
沉辅臣1黄树林1珍林1号周嘉慧3紫兰毛1
杨子杰1,4临沂杨5吴建1张跃
抽象的

大型语言模型(LLM)的出现正推动自动化科学发现迈向新的阶段,基于LLM的人工智能(AI)科学家系统如今在科学研究中占据主导地位。AI科学家系统领域已涌现出多篇具有影响力的论文,人工智能生成的研究论文已被ICLR 2025研讨会接收,这表明能够揭示人类此前未知现象的类人AI科学家可能很快就会成为现实。本文聚焦于一个核心问题:AI科学家距离改变世界、重塑科学研究范式还有多远?为了回答这个问题,我们以展望为导向,对AI科学家系统的现有成就进行了全面分析,指出了关键瓶颈以及构建能够产生突破性发现、解决重大挑战的科学智能体所需的关键组件。我们希望本文能够帮助读者更清晰地理解当前AI科学家系统的局限性,阐明我们目前所处的位置、存在的不足以及科学AI的最终目标。

关键词:人工智能科学家,大型语言模型

 

日期:2025年8月1

代码库https ://github.com/ResearAI/Awesome-AI-Scientist

联系方式:zhangyue@westlake.edu.cn

1介绍

科学发现是人类文明进步的根本驱动力。从牛顿运动定律和万有引力定律 (牛顿,1833牛顿和奇滕登,1850通过爱因斯坦的相对论 (爱因斯坦,1922),到人工智能 (LeCun等人,2015埃尔特尔2024每一次重大的科学突破都拓展了人类理解的边界,并推动了社会进步。传统上,人类作为科学研究的主要主体,遵循着一套系统的探索路径。这一过程通常始于观察和学习,以此建立科学知识的基础(知识获取),随后提出科学假设来解决尚未解决的问题(思想产生)。接下来的步骤是通过大量的实验和理论分析,对这些假设进行严格的检验和证伪(验证和证伪)。最后,研究会根据实验或理论结果不断完善,从而推动科学知识的 持续发展(Langley2012)1987)。

请参考图注

图 1:人工智能科学家的能力等级图,展示了从基础知识获取(等级 1)、创意生成(等级 2)、严格的假设验证与证伪(等级 3)到持续演进(等级 4)的进阶过程。我们概述了每个能力等级的核心功能。

请参考图注

图 2:本文概述了人工智能科学家系统目前的能力格局,并将其分为四个递进级别。我们总结了每个级别目前的成就,并重点指出人工智能科学家系统在能够自主做出突破性科学发现之前存在的关键差距。

然而,研究过程本身就受到人类局限性的限制,例如时间有限和认知能力不足,导致文献综述速度缓慢、知识领域相对狭窄、假设生成存在偏差以及实验执行效率低下 (Ioannidis,2005贝克2016为了解决这些问题,人们越来越致力于实现科学发现的自动化 (Yang等人,20232025a早期的研究主要集中在利用深度学习技术 (LeCun等人,2015Vaswani等人2017为了支持知识获取,例如,预训练的语言模型已经过领域特定知识的调整,以更好地表示科学信息 (Gupta等人,2022然而,由于模型容量和高质量科学数据可用性的限制,这些方法主要作为科学工具,在一定程度上加速了人类的研究过程。近年来,基于大规模、高质量语料库训练的长文本模型(LLM)在长文本场景的理解和生成方面都展现出了卓越的能力,使得基于已积累的知识生成新颖且可行的科学假设成为可能 (Si et al.,2024),并使用自动化实验工具严格评估这些假设 (Wierenga等人,2023Starace等人2025这一进展正推动自动化科学发现迈向新的阶段,其中基于LLM的AI科学家系统 (Lu等人,2024翁等人2025如今,人工智能科学家正引领着探索的潮流。一旦拥有超越人类极限的能力(例如,克服记忆容量限制的能力),人工智能科学家将有可能做出突破性发现,从而解决医学、能源和环境等领域的重大挑战。我们现在准备探讨该领域的一个核心问题:人工智能科学家距离改变世界、重塑科学研究范式还有多远?

为了回答这个问题,我们从前景的角度回顾了现有成果。图 1展示了成熟的人工智能科学家所需的能力层级,我们认为这为当前和未来的相关研究提供了一个合理的路线图。具体而言,我们的调研引入了一个能力层级框架,系统地定义了人工智能科学家发展的各个阶段,包括:(1)知识获取,这是人工智能科学家的基础能力,涵盖了自主检索、审查和理解现有研究中科学知识的能力。(2)创意生成,指的是大规模生成创新且可行的假设的能力。这种能力是区分人工智能科学家系统与自动化科学工具的关键特征。(3)验证与证伪,指的是系统地设计、实施和分析实验以测试并可能证伪人工智能生成的科学假设的能力,这使得人工智能科学家从创意生成器转变为自主的科学智能。(4)演化,指的是基于内部和外部反馈不断提升整体研究能力的能力,这对于初级人工智能科学家演化为成熟的科学智能体至关重要。我们通过这一能力框架的视角,对当前的研究进行批判性分析,找出自主科学智能产生突破性发现的关键瓶颈和缺失的组成部分。

针对上述能力,已有诸多尝试、成功案例和局限性(图 2)。我们首先系统地回顾了现有人工智能科学家系统在知识获取(第 2节)、创意生成(第 3节)以及验证与证伪(第 4节)能力方面的成就,并将代表性方法映射到各个能力层级。然后,我们概述了人工智能评审系统的发展历程,并提供了实证证据,表明当前的人工智能科学家系统缺乏独立进行高质量科学发现的能力(第 5节)。为了克服这些局限性,人工智能科学家系统必须具备进化能力(第 6节),从而朝着重塑科学研究范式的目标迈进。此外,我们全面考察了当前人工智能科学家研究面临的挑战(第 7节),并讨论了未来的发展方向和未解决的问题(第 8节),为实现真正自主的科学智能提供了一条合理的路线图。

2知识获取

Definition: Knowledge acquisition is the foundational capability of an AI Scientist, defined as its autonomous capability to retrieve, review, and comprehend domain-specific knowledge from existing scientific literature, thereby systematically establishing a scientific knowledge base for subsequent research.

知识获取是人工智能科学家的基础能力,它涵盖了自主检索、审查和理解现有科学研究中特定领域知识的能力。 这项关键能力构建了后续研究活动所需的知识库,其运作方式类似于人类研究人员的文献综述过程。我们系统地考察了现代人工智能科学家系统,特别是基于语言学习模型(LLM)的方法,如何应对以下两大挑战:(1)文献检索/整理(从海量语料库中筛选相关研究)和(2)知识检索/摘要(提取结构化见解)。有趣的是,早在语言学习模型出现之前,人工智能科学家系统的基础概念就已经引起了广泛关注,许多小规模语言模型在知识获取阶段都取得了显著的成功。因此,在本节中,我们将人工智能科学家系统在知识获取方面的研究工作分为LLM 出现之前的时代(大致在 2020 年之前)和LLM 时代(从 2020 年开始,以 GPT-3 等 LLM 的出现为标志 (Brown 等人),2020)。

2.1法学硕士时代之前的各种方法

在 LLM 出现之前,研究人员通过使用特定领域的知识微调小型预训练语言模型 (PLM) 来学习大量的科学表征,从而在自动知识获取方面取得了显著进展 (Beltagy 等人,2019Jin等人2019李等人2023这些模型在结构化文本挖掘和从科学文献中提取知识方面展现出卓越的能力,为基于LLM的更高级方法铺平了道路。

文献。 在LLM兴起之前,早期的自动化知识获取系统主要依赖于规模较小的PLM,这些PLM是在大量的科学语料库上训练的。SciBERT  (Beltagy等人,2019是首个在 114 万篇论文上进行预训练的 PLM 模型,在科学命名实体识别 (NER )和引文分类任务上取得了优异的性能,显著提高了研究人员的科研效率,尤其是在计算机科学领域。类似地,SCHOLARBERT  (Hong 等人,2023),在 221B 个学术文本标记上预训练,极大地增强了对科学文献上下文的理解。特定领域的模型,例如 CinicalBERT  (Huang 等人,2019),PubMedBERT  (Gu等人,2020),BioELMo  (Jin等人,2019),BioBERT  (Lee等人,2020),BioMegatron  (Shin等人,2020),BioM-Transformers  (Alrowili 和 Shanker,2021),以及 MatSciBERT  (Gupta 等人,2022这些模型在高质量的临床、生物学和化学语料库上进行了预训练。它们专注于结构化文本挖掘,利用基于规则的解析和基于图的引文分析等技术,从科学摘要或全文中提取关键短语、实体和关系 (Cachola 等人,2020a) . Kang 等人(2022)利用作者网络图方法揭示用户与论文互动背后的深层联系。类似地,Kang等人(2023构建一个由用户选择的论文种子组成的作者委员会,同时接受来自多个来源的信号,以动态发现相关文献。虽然上述LLM时代之前的研究在自动化知识获取方面取得了显著成功,但它们的可扩展性和对上下文的理解存在根本性的局限性,这为更复杂的知识获取方法奠定了基础。

实验。 在LLM时代之前,研究人员也探索从实验结果中提取知识(例如,构建排行榜)。继利用NLP-progress  1和Papers with Code  2等数据源之后,SciGen  (Moosavi等人,2021)和数值 NLG  (Suadaa 等人,2021是两个用于评估语言模型在科学表格描述生成方面能力的基准测试。然而,这些工作缺乏严格的质量保证措施。例如,不同排行榜之间科学实体的定义并不统一,相关出版物的覆盖范围也不完整。相比之下,SCICM  (Li等人,2023)选择使用arXiv,这是一个开放获取的预印本库,收录了近240万篇不同领域的学术文章,提供了大量相关出版物。与SCICM类似,TDMS-IE  (Hou等人,2019)和 AxCell  (Kardas 等人,2020提取“任务-数据集-模型”三元组以及实验结果实体,以自动构建排行榜。这项工作被后续方法(例如 TELIN  (Yang 等人))所扩展。2022)和 ORKG-Leaderboards  (KABENAMUALU 等人,2023这标志着研究效率提升的明显趋势。

2.2LLM时代方法

文献管理(LLM)对人工智能科学家系统知识获取能力的变革性影响标志着“文献管理时代”的开始。这些进步涵盖文献检索工具包、面向理念和实验的知识提取技术以及专门的评估基准。与此同时,它们也凸显了检索精度和多文档摘要方面仍然存在的挑战。

2.2.1文献检索与整理

研究人员开发了专门的工具包和系统,可以高效地从各种来源(例如 PubMed  3、arXiv  4)筛选、选择和推荐相关的科学文献。在这些工作中,PaperWeaver 等系统 (Lee 等人,2024)因其多功能性而脱颖而出,因为它们能够支持文献检索流程中的多个子阶段。基于此进展,DORA AI Scientist  (Naumov等人,2025)通过引入检索增强生成(RAG)进一步推进了该领域的发展 (Gao等人,2023将上下文相关性融入其核心搜索过程,从而增强上下文相关性和自动化程度。尽管取得了这些进步,但并非所有系统都是完全自主的。例如,像 CodeScientist 这样的半自动框架 (Jansen 等人,2025)仍然依赖用户提供的论文列表进行构思,这凸显了在实现真正自动化和高精度的文献发现方面仍然面临的挑战。

基于这些方法,研究人员开发了多种用于搜索和筛选科学文献的实现方案。Schmidgall 等人(2025)利用arXiv API检索论文并执行摘要、全文提取和整理任务。同时, Jiabin等人(2025将基于引用的过滤应用于 arXiv 上被引用次数最多的领域论文。除了单智能体检索之外,多智能体系统也得到了探索。Gottweis 等人(2025)集成网络搜索工具,而 Lu 等人(2024)利用 Semantic Sc​​holar 的 API 来识别用于生成假设的相关论文。在 RAG 领域,Lála 等人(2023)和Skarlinski 等人(2024本文介绍了用于科学问答任务的 PaperQA 和 PaperQA2。此外,PaSa (He 等人)体现了对更高自主性的追求。 2025),它采用双智能体架构和会话级强化学习,能够自主搜索、分析论文并探索复杂查询的引文网络。尽管取得了这些进展,Beel 等人(2025需要注意的是,现有系统仍然严重依赖于基于关键词的匹配,经常检索到经典但可能过时的论文,这凸显了需要更多上下文感知的检索策略。

2.2.2知识检索与摘要

基于已充分处理的文献,知识检索和摘要方法旨在从结构化和非结构化数据中提取知识。这项工作主要包含两个部分:(1)面向概念的方法,从研究论文中提取关键概念和见解;(2)面向实验的方法,检索实验结果并将其总结成综合报告。LLM(文献管理软件)在这一阶段发挥着关键作用,它负责处理和组织来自文献的宝贵知识。

以概念为导向的方法利用逻辑逻辑模型(LLM)从科学文献中提取关键概念和见解。这些方法可以分为以下几类:(1) 直接提示法是一种基础方法,其中基于LLM的任务执行直接由明确的提示指令引导。然而,由于上下文长度和检索准确率等限制,这些方法很少被采用,通常作为基准方法 (Dagdelen等人,2024Gupta等人2024姚等人2025)。(2) 基于文献结构的方法利用科学文献固有的组织结构或基于论文结构的预定义计划(例如,摘要、引言和结论(AIC))  (Sharma 等人,2019卡乔拉等人2020bTakeshita等人2022)。(3) 基于 RAG 的方法通过首先检索相关的外部信息,然后将其用作生成摘要的上下文,从而增强 LLM 的摘要能力,旨在生成更真实、更及时的输出 (Ali 等人,2024Agarwal等人2024b例如,LitLLM  (Agarwal等人,2024a)利用 RAG 进行文献检索和知识检索。(4) 基于多智能体的方法涉及多智能体系统的协作以生成文献综述。例如,Schmidgall 和 Moor (2025)整合多个LLM以加速知识检索和摘要过程。

实验导向方法 涉及从科学文献中提取实验结果,并将其总结成综合报告。LLM(逻辑逻辑模型)在这一过程中发挥着关键作用,它们分析结构化数据、解释实验设计并生成综合摘要。然而,由于需要精确提取任务-模型-数据集三元组以及研究基准的动态特性,这项任务变得复杂。例如,LEGO-bench  (Singh 等人,2024Park等人提出了一种用于评估生成科学排行榜系统的基准,该系统力求了解最新的前沿研究。通过从多个数据集中半自动提取实验数据,Park等人(2025)展示了比较方法如何能够带来新的科学发现。同时,Wu等人(2025)提出领导者自动生成(LAG),它实施了一个全面的四阶段动态排行榜生成流程,包括表格检索、数据集成、排行榜生成以及基于质量选择最有效的排行榜。

2.3评估

评估基准在评估人工智能科学家系统在知识获取方面的能力方面发挥着至关重要的作用。这些基准侧重于不同的方面,从信息检索准确率和摘要质量到知识结构生成。

经典的科学总结。对知识获取能力的早期评估源于文献总结作品 (Cachola等人,2020bTakeshita等人2022SCITLDR (Cachola等人)收录了超过5400篇科学论文摘要 。2020b)要求模型输出科学论文的极度压缩摘要。X-SCITLDR  (Cachola等人,)遵循与SCITLDR相同的格式,2020b是一个多语言数据集,用于测试不同跨语言摘要策略的有效性。这些基准测试仅使用原始科学论文的部分内容(例如摘要)作为测试项,因此旨在测试上下文窗口相对较短的模型。

文献检索。除了摘要之外,知识获取评估的另一个关键维度在于模型检索相关科学文献的能力。CiteME  (Press 等人,2024LitSearch (Ajith 等人)是一个最新的基准测试,旨在通过识别基于 LLM 的科学代理能否根据给定的上下文引用正确的论文来评估它们。 2024)是另一个评估科学文献检索系统能力的基准,包含 597 个人工整理的查询和 64000 多篇论文,用于测试复杂查询理解和相关文档定位的能力。

自动化文献综述和工具。 最近的基准测试开始评估LLM执行自动化文献综述和辅助科学知识组织的能力。例如,Yun等人(2023研究发现,研究人员在文献综述任务中倾向于使用透明的人工智能工具而非黑箱系统。基于此,Hsu等人(2024他们引入了 CHIME,这是一个半自动生成的基准,用于评估 LLM 生成和链接主题类别的能力,尽管这些模型在将具体研究分配到适当主题方面仍然存在困难。类似地,Agarwal 等人(2024b)提出新的评估协议和测试集,这些协议和测试集源自 arXiv 论文,旨在严格测试 LLM 是否能够撰写文献综述,重点关注零样本完整性以及避免模型演进过程中测试集受到污染。

3创意产生

Definition: The idea generation capability of an AI scientist lies in its capability to autonomously formulate innovative and feasible scientific hypotheses based on acquired knowledge and existing methods. This capability distinguishes AI scientist systems from automated scientific tools.

在传统的以人为中心的科研范式中,研究人员负责提出待验证的想法,而人工智能则负责处理诸如想法的实施和完善等劳动密集型任务。在这种范式下,人工智能被视为一种自动化工具,而非科学研究的主要参与者。LLM(知识库管理)的出现标志着一种转变,因为人工智能现在可以自主地从海量的科学文献中检索、审查和理解特定领域的知识(第 2节)。因此,越来越多的研究致力于开发能够自主大规模生成创新且可行的假设的人工智能科学家系统 (Hu等人,2024Lu等人2024Si等人2024翁等人2025在这种新范式中,人工智能科学家系统(区别于自动化科学工具)成为科学研究的核心驱动力,负责提出新的假设,而人类或自动化实验工具则作为这些假设的执行者。

3.1方法

创意生成的经典形式化方法可以追溯到斯旺森(1986提出了“ABC”模型:假设两个概念A和C在文献中都与某个中间概念B同时出现,则认为它们之间存在关联。受此启发,后续研究采用了图模型(Wang 等人,2019Sybrandt等人2020Youn等人2022)或词向量 (Tshitoyan等人,2019通过识别概念对之间的联系来生成科学假设。然而,将复杂的科学思想转化为二进制形式的概念联系不仅限制了输入类型,而且显著限制了所生成假设的表达能力  (Moreau等人,2021王等人2024b)。

近年来,LLM 的快速发展为各个领域的研究人员探索如何通过专门的提示策略 使 LLM 能够以自然语言的形式生成创新的科学假设开辟了新的可能性(Li 等人,2024b胡等人2024Lu等人2024山田等人2025Jansen等人2025),训练后方法 (Qi等人,2023王等人2024b翁等人2025),或多智能体协作 (Liu等人,2024杨等人20242025bGottweis等人2025例如,李等人从人类进行研究的方式中汲取灵感(2024bSi等人提出了“思想链”(CoI)智能体。该智能体基于 LLM,将相关文献组织成链状结构,有效地反映了研究领域的渐进发展,并能够基于现有文献生成高质量的假设。Si等人还强调了检索的重要性。2024他们采用了一种融合了检索增强技术并利用了推理时间扩展方面最新进展的LLM代理。他们促使LLM为每个研究主题生成4000个种子想法,并使用重排序器来选择最高质量的假设。另一项值得关注的工作侧重于训练后优化。例如,Wang等人(2024b本文介绍了 SCIMON,这是一个旨在基于从科学文献中动态检索的背景上下文生成自然语言假设的框架。SCIMON 进一步微调了 T5 模型 (Raffel 等人,2020)同时使用上下文对比目标和语言建模目标,然后通过迭代过程显式地优化生成的新颖性假设。同时,人工智能科学家 (Lu等人,2024)采用了多轮思维链 (Wei等人,2022)和自我反思 (Shinn等人,2023为了完善和发展每个假设,除了单个智能体之外,协作式多智能体系统也展现出了良好的前景。例如,Yang 等人(2025b)开发 MOOSE-CHEM,这是一个基于 LLM 的多智能体框架,分三个阶段运行:(1)搜索化学文献以寻找灵感论文,(2)利用这些灵感提出与目标研究问题相关的假设,以及(3)识别和排序高质量的假设。

3.2评估

表1:人工智能生成的科学假设的常用评价标准。

标准  描述
新奇  该假设是否具有创造性,是否与该主题的现有研究有所不同,以及是否提供了新的见解。
可行性  该假设作为研究项目的基础,其实用性和可实现性如何?
明晰  假设是否表述清晰易懂。
激动  如果将该假设发展成为一项全面的研究工作,可能会产生巨大的轰动效应和影响。

对所生成的假设的评估通常基于反映其质量的多个标准进行,包括但不限于:新颖性、可行性、清晰度和吸引力 (Si 等人,2024Chai等人2024王等人2024b李等人2024b)。各项评价标准的详细信息见表 1。基于这些评价标准,研究人员通常采用两种方法来评估人工智能生成的假设的质量:自动化评价和人工评价。其中,自动化方法 (Li等人,2024b杨等人2025bChai等人2024杨等人2024Chai等人2024通常情况下,这类方法会采用功能强大的逻辑回归模型(LLM)作为自动评估工具来评估假设质量。例如,Chai 等人(2024)采用 Claude 3.5 模型 (人为,2024将每个假设与背景和研究主题进行比较,确保其展现出足够的创新性、科学性和清晰度。Li等人(2024b提出了 Idea Arena,这是一个成对评估系统,其中 LLM 评判员对成对比较中的假设进行排序,并计算每个假设生成模型的 ELO 分数。然而,LLM作为评估器的性能受多种因素影响,例如训练数据的多样性 (Shi 等人,2024),固有模型偏差 (Zheng等人,2023),以及评估不确定性 (谢等人,2025)。

相比之下,人工评价 (Qi等人,2023Si等人2024胡等人2024王等人2024b由于定量指标往往不足,因此,方法论被认为是评估假设的黄金标准。例如,Hu等人(2024)招募一个由 10 位专家组成的小组,所有专家均拥有博士学位或教授职称,根据新颖性和整体质量评估假设。此外,Si 等人(2024他们进行了一项大规模的人工研究,招募了 79 位专家研究人员,对来自三种不同情境的 49 个想法进行盲审:专家撰写的想法、人工智能生成的想法以及由人类专家重新排序的人工智能生成的想法。他们发现,LLM 生成的想法被认为更具新颖性(p与人类专家撰写的文本相比,基于文本生成方法的假设质量更高(< 0.05),尽管其可行性略低。此外,一些研究还利用基于参考文献的文本生成指标来评估假设质量。例如,Qi 等人(2023)采用 BLEU  (Papineni 等人,2002)和 ROUGE  (林,2004)分数用于衡量生成输出与真实参考文献之间的词语重叠度。Yang等人 (2025b)采用匹配分数,该分数使用 6 点李克特量表计算生成的假设与原始假设之间的相似性。

值得注意的是,目前大多数评估人工智能生成假设可行性的方法仍然严重依赖于人类直觉和基于文本描述的主观估计。虽然这种方法可以有效地过滤掉明显不可行的假设,但它缺乏准确性和客观性 (Krishna等人,2023Karpinska等人2021因此,评估假设的可行性也需要切实可行的方法(例如,将假设转化为可执行代码)来进行实证验证和证伪。在本综述中,我们将设计实验来验证新的科学假设的能力归类为一种更高级的验证和证伪形式,我们将在第4节中详细讨论 。

4验证与证伪

Definition: This capability allows an AI Scientist to systematically design, implement, and analyze experiments to verify and falsify the AI-generated scientific hypotheses. Crucially, the verification and falsification capability is what completes the research cycle, transforming the AI Scientist from an idea generator into an autonomous scientific intelligence.

尽管人工智能系统在生成科学假设方面展现出日益增长的能力,但人们仍然对其可靠性和真正的科学价值存在担忧。正如第三节所述 目前对这些人工智能生成假设的评估,尤其是在可行性方面,严重依赖于主观的人类评价或肤浅的文本相似度指标。这些方法从根本上缺乏只有实际实验验证才能提供的实证严谨性,这凸显了验证和证伪能力不可或缺的作用。在模拟或真实环境中积极测试和验证假设(验证)并严格质疑假设(证伪)的能力,是构成一个能够进行闭环科学发现的完整人工智能科学家的关键要素。

类型 总引用次数 平均引用次数
未实施 216 10.3
实施 325 25.0

请参考图注

图 3:本文分析了arXiv上人工智能科学家系统领域的论文数量。上图显示了迄今为止的平均引用次数,并按是否包含实现细节进行了分类。下图显示了相同分类下论文总数的增长情况。

传统上,科学验证需要科学家设计、实施和分析实验 (Popper,2005库恩2014近年来,随着LLM和自动化实验工具(例如AlphaFold  (Jumper等人))的快速发展,2021人工智能科学家系统验证和证伪科学假设的能力取得了显著发展,从早期以直接代码执行和结果匹配等任务为中心的方法,演变为更复杂、更全面的流程。例如,人工智能科学家 (Lu等人,2024)设计和执行具有自动代码生成和纠错功能的实验,从而实现全自动的开放式科学发现。

然而,验证和证伪过程对于当前的AI Scientist系统而言仍然是一项艰巨的任务。对截至2025年5月23日arXiv上发表的AI Scientist论文进行统计分析,揭示了验证和证伪相关的挑战以及社区对其的重视程度。如图 3所示,尽管该领域的论文总数在增加,但主要侧重于提出想法而未提供具体实现细节的研究数量始终高于包含此类实现的研究。尽管论文数量存在这种差异,但图3的上半部分 进一步强调了一个关键的反例:包含实质性实现细节的论文获得了更高的平均引用次数,这表明AI Scientist社区对可执行验证的高度重视。

4.1方法

表2:最先进的LLM在实现基准测试中表现出相对较低的准确率。所列基准测试涵盖多个领域。下表详细列出了这些测试的任务、领域、规模、方法和性能。

基准  任务描述 域名 规模 法学硕士 准确性
MLE-Bench ( Chan等人,2024)  人工智能训练 计算机科学 75 OpenAI o1-preview 16.90%
CORE-Bench ( Siegel等人,2024  科学论文复制 计算机科学、社会科学和医学 270 OpenAI GPT-4o 55.56%
SciReplicate-Bench ( Xiang等人,2025)  代码生成 计算机科学 100 克劳德十四行诗 3.7 39.00%
PaperBench ( Starace等人,2025  ICML论文复制 计算机科学 8,316 OpenAI o1-high 26.00%
ML-Dev-Bench ( Padigela 等人,2025)  人工智能训练 计算机科学 30 克劳德-十四行诗-3.5 50.00%

验证和证伪的最终目标主要在于设计、实施和分析实验,以评估人工智能生成的假设是否可行。然而,考虑到不同科学领域(例如化学、生物学和医学)实验的局限性,例如实验场地、设备和实验安全等,目前人工智能科学家系统主要关注计算机科学领域,特别是机器学习领域中的想法验证和证伪。

实验设计方面,人工智能科学家领域已经出现了几种创新方法。BioPlanner  (Liu 和 Shah,2023DSBench (Jing等人)提出了一种自动化评估框架,用于评估LLM在生物学领域规划实验的能力。 2025)和 ScienceAgentBench  (Chen 等人,2024)评估代理人在数据驱动的科学发现的实验设计中的能力。Yang 等人(2023)是首个采用LLM作为“主脑科学家”(类似于首席研究员)的工作,由其承担核心角色并指导完全闭环的研究。后续的AI Scientist系统,例如AI Scientist  (Lu等人,2024进一步利用LLM代理自主提出研究思路、构建可检验的假设并设计高层次的实验方案。这些方案通常包括定义变量、选择数据集、选择基线模型以及概述评估指标。然而,科学实验设计的多样性和复杂性给当前的AI科学家系统带来了巨大的挑战。这些AI科学家系统生成的实验设计往往缺乏科学严谨性、创新性和实用性,难以满足高层次研究的需求 (Huang等人,2025a翁等人2025)。

理论上,实现是实验中最重要也是最困难的部分,通常通过存储库级别的代码生成来解决。例如,基于LLM的方法,如ToolGen  (Wang等人,2024a),提出了一种集成自动补全工具以生成具有可靠依赖关系的存储库级代码的方法。CoCoGen  (Bi 等人,2024CatCoder (Pan等人)利用从代码库中提取的信息,迭代地对齐并修复错误。 2024b通过集成相关代码和类型上下文,增强了存储库级别的代码生成。基于代理的方法展现了更强大的性能。CodeAgent  (Zhang 等人,2024aRepoCoder (Zhang 等人)集成了五种编程工具,支持与软件工件进行交互,以进行信息检索、代码符号导航和代码测试。 2023RepoGraph(Ouyang 等人)通过在迭代检索生成管道中集成基于相似性的检索器和预训练的代码语言模型,简化了存储库级别的代码补全过程。更贴近实际场景的是 RepoGraph  (Ouyang 等人,2024RepoGraph在代码行级别运行,与以往的文件级浏览方法相比,它提供了一种更精细的方法。图中的每个节点代表一行代码,边代表代码定义和引用之间的依赖关系。RepoGraph 通过在 SWE-bench 测试中实现平均 32.8% 的相对改进,提高了现有方法的成功率 (Jimenez 等人,2023) .SciCode  (Tian等人,2024AIDE (Jiang等人)将科学存储库级代码的生成分解为多个子问题,每个子问题都涉及知识回忆、推理和代码合成。 2025MLR-Copilot (Li 等人)将机器学习研究形式化为代码优化问题,并将试错法建模为潜在解空间中的树搜索。 2024c进一步提出了一种名为 ExperimentAgent 的程序,用于将实验计划转换为可执行的实验代码,其关键在于整合了人类反馈和迭代调试机制来应对执行过程中的复杂性。为了追求更高的自主性,Lin 等人(2025本文提出了一种基于LLM的多智能体框架AutoP2C,该框架能够处理研究论文中的文本和视觉内容,自动生成可执行代码库。这些持续的进展凸显了人们不断努力通过日益复杂的方法来克服科学实现中固有的困难。

分析作为实验过程的最后阶段,在将实验结果整理成条理清晰的实验报告中起着至关重要的作用。近年来,诸如 MCX-LLM  (Yen 和 Fang,2024研究人员探索了使用语言学习模型( LLM)将自然语言描述转换为机器可读输入,用于运行蒙特卡罗模拟,从而提高分析效率。为了评估此类系统的能力,研究人员使用了诸如 FigureQA  (Kahou 等人)之类的基准测试。2017),ArxivQA  (Li等人,2024a),以及 MMSCI  (Li 等人,2025已经开发出一些工具,重点在于提高智能体理解和推理复杂图形(包括图表和表格)的能力。除了数据解释之外,还有诸如 LLM-ref  (Fuad 和 Chen,2024这些系统通过支持整合来自多个来源文档的信息并增强文章写作过程中的参考文献管理,进一步协助研究人员。基于这些进展,最先进的AI Scientist系统利用LLM驱动的代码生成来自动执行稳健的统计分析,并生成诸如图表、表格和图形等可视化图表。这种自动化极大地简化了实验结果的报告流程。此外,这些系统通常会执行多次独立的实验并汇总结果,从而实现全面的元分析。在分析阶段之后,一些AI Scientist系统 (例如Intology、2025山田等人2025这些系统甚至可以将研究结果综合成科学论文,自动生成结构化报告,其中包含方法论细节、数据分析、结果和结论,并采用标准的学术格式。虽然自动论文写作是这些系统的一个重要应用,但值得注意的是,论文生成并非人工智能科学家系统的核心能力。因此,本调查的重点仍然是分析和推理方面,而不是最终研究论文的撰写。

4.2评估

在实践中实现稳健的验证和证伪仍然是当前人工智能科学家系统面临的一大难题,即使是最先进的LLM在各种高要求基准测试中的表现也鲜明地体现了这一点,如表 2所示。这些基准测试任务包括执行端到端的AI模型训练工作流程、直接从科学出版物中复现方法和经验结果,以及从研究论文中嵌入的复杂算法描述中准确生成可执行代码。例如,MLE-Bench  (Chan等人,2024PaperBench (Starace等人)评估了解决Kaggle机器学习任务的能力,其中OpenAI的“o1-preview”仅取得了16.90%的奖牌成功率。 2025)需要从头开始复现 ICML 研究论文,OpenAI 的“o1-high”在这方面的复现率仅为 26.00%。SciReplicate-Bench (Xiang 等人)也进一步证明了这些挑战。2025),一个专注于从算法描述生成可执行代码的基准测试(Claude-Sonnet-3.7 的执行准确率仅为 39.00%);CORE-Bench  (Siegel 等人,2024),涉及复现来自不同领域科学论文的计算结果(OpenAI 的 GPT-4o 在中等难度任务上达到了 55.56% 的准确率);以及 ML-Dev-Bench  (Padigela 等人,2025该评估工具能够评估机器学习开发工作流程中各种任务的性能(Claude-Sonnet-3.5 的成功率为 50.00%)。这些评估结果一致表明,LLM 在将概念理解或初始计划转化为可验证的正确且可运行的代码方面面临着巨大的困难,这凸显了其验证能力的根本局限性,并强调了系统化的验证和实施能力对于人工智能科学家系统成熟的重要性。

5审查系统

Definition: An AI reviewer system comprehensively assesses the generated manuscripts to provide insightful reviews, aiming to enhance the quality of the scientific artifact produced by AI Scientist systems.

同行评审对于完善科学工作至关重要,但传统的同行评审制度面临着诸多挑战,尤其是在计算机科学等快速发展的领域,新的研究成果可能在发表之前就已经过时。同时,同行评审制度依赖于数量有限的评审员,而他们往往不堪重负,导致评审工作出现延误、偏见、不一致,有时甚至出现不公平的结果 (Stelmakh et al.,2020张等人2022Fox等人2023为了解决这些问题,研究人员正在积极探索利用人工智能系统来支持同行评审生命周期中的科学评审工作。总体而言,人工智能评审系统的发展可以分为两个阶段,以LLM(生命周期管理)的出现为标志:(1)LLM出现之前的阶段:早期的人工智能评审系统主要侧重于基于内容分析和评审专家的专业知识自动匹配评审专家和论文 (Charlin和Zemel,2013Stelmakh等人2019,斯特尔马赫,2021这些系统还处理筛选和预检流程,例如验证是否符合提交指南、查重和匿名性检查 (Goldberg等人,2024aLee等人2025)。 (2)基于LLM的AI审稿系统:随着LLM的出现,AI审稿人的能力得到了极大的提升。一项关键的进步是能够自动生成详细、结构化的审稿意见。这些审稿意见通常包括摘要、优缺点评估以及建设性反馈,旨在使审稿过程更加高效和公平,最终提高科学评价的速度和质量 (Wang等人,2020伊达尔和艾哈迈迪,2024Tyser等人2024Pendyala等人2025朱等人2025)。

5.1方法

为了处理评审过程中的特定环节,人们开发了不同的人工智能评审系统技术。这些方法涵盖了从简单的任务(例如筛选和分类提交内容)到复杂的任务 (Wang等人,2024c曹等人2024Jaumann等人2025从简单的任务到更复杂的任务,包括撰写审稿意见、模拟审稿人讨论以及对论文内容进行推理 (Peng等人,2024苏等人2025孙等人2024周等人2025a朱等人2025Jin等人2024我们根据这些方法的基本范式和它们所解决的任务的复杂性对这些方法进行分类(图 4 

基于分类和评分的人工智能审稿系统主要侧重于评估学术论文,并根据预定义的标准分配量化分数 (Zhu等人,2025),并根据特定属性(例如,与会议的相关性)对它们进行分类 (Leyton-Brown 等人,2024)),或筛选文献以纳入系统评价(Joos等人,2024这些系统通常针对学术论文中特定的、可衡量的方面,而不是生成整体性的评价 (Wang等人,2024dLiang等人2025例如,ReviewRobot  (Wang等人,2020)采用基于知识图谱的框架来预测评论分数并生成结构化证据,强调可解释性。其分数预测准确率达到 71.4%,并且其生成的评论中有相当一部分被人类专家认为是有效且有建设性的。类似地,RelevAI-Reviewer (Couto 等人,2024)将综述论文评审概念化为分类任务,并使用超过 25,000 个实例的数据集对人工智能评估相关性的能力进行了基准测试。在实证实验方面,NeurIPS 2024 委员会采用了 LLM 对提交的论文进行系统分类,并对照标准化清单进行检查(Goldberg 等人,2024b超过 70% 的作者认为该系统很有用,70% 的作者根据详细的反馈进行了实质性的修改。

请参考图注

图 4:人工智能评审系统可分为三种复杂度递增的范式。首先是(1)分类评分系统,它提供量化输出(例如,分数或接受/拒绝决定)。这种范式逐渐演变为(2)生成系统,它生成叙述性评审文本。近年来,一种更先进的范式采用了(3)多智能体系统,其中多个人工智能智能体协作生成全面、多方面的评估。

基于生成的AI审稿系统旨在以自然语言生成学术评论,模仿人类审稿人的叙述性输出。例如, Reviewer2 (Gao等人,2024OpenReviewer (Tyser 等人)引入了一个两阶段框架,首先对潜在评审方面的分布进行建模,然后生成提示以指导法学硕士(LLM)撰写详细的学术评审报告。2024),一个专门的、拥有 80 亿参数的 LLM,经过 79,000 篇专家评审的微调,能够处理 PDF 提交内容,生成符合会议指南的结构化评审意见,尤其值得一提的是,它比 GPT-4 等通用 LLM 生成了更多“批判性和现实性的评审意见”。另一种自动化方法在(Wu et al.,2024CycleReviewer(Weng等人)利用LLM分析论文、提取关键信息并生成见解,同时采取质量控制措施来减少幻觉,据报道,其在案例研究中达到了人工审阅质量的水平。此外,CycleReviewer  (Weng等人,2025提供了一套经过专门训练的语言学习模型(LLM),用于生成专家级意见和评估分数,与人工审阅者相比,分数预测的平均绝对误差(MAE)降低了26.89%。这些系统面临的关键挑战在于,如何超越流畅的文本生成,提供真正有洞察力和建设性的批评,避免过于积极或肤浅的评价 (Shojaee等人,2025Laskar等人2024)。

表3:AI Reviewer 基准测试概述,包括任务重点、样本规模和数据来源。

姓名  任务重点 规模 来源
PeerRead ( Kang等人,2018)  预测建模 14700 ACL、NeurIPS、ICLR
ASAP-Review (袁等人,2022  预测与生成 8877 ICLR、NeurIPS
MOPRD ( Lin等人,2023)  评论生成 6578 PeerJ期刊
RelevAI 审稿人( Couto 等人,2024  预测建模 25164 现有调查报告
ReviewMT ( Tan等人,2024)  评论生成 26841 ICLR,《自然通讯》
审稿人2 ( Gao等人,2024  评论生成 27000 计算机科学会议
SWIF 2 T ( Chamoun 等人,2024)  评论生成 300 精选同行评议
自动评估指标( Höpner等人,2025  预测建模 15002 OpenReview、语义学者
PeerQA ( Baumgärtner 等人,2025)  文本分析 579 计算机科学、地球科学、健康等领域的论文
人工智能/人类同行评审( Yu 等人,2025  文本分析 788984 ICLR、NeurIPS
Review-5K ( Weng 等人,2025)  预测与生成 24991 ICLR 2024
DeepReview (朱等人,2025  评论生成 14664 ICLR 2024、2025

多智能体人工智能评审系统。 鉴于同行评审本质上是一个协作过程 (Miyao,2019Beygelzimer等人2023研究人员已开始探索基于多智能体框架的人工智能审稿系统。这些系统通常采用多个具有不同角色(例如,元审稿人、领域主席)的交互式人工智能智能体来模拟讨论,从而生成更全面、更细致的审稿意见。例如,AgentReview  (Jin等人,2024)使用 LLM 代理来研究评论动态和潜在偏见;ReviewAgents  (Gao 等人,2025提出了一种多角色框架来模拟人类推理过程;以及 MARG  (D'Arcy 等人,2024它将论文分发给专业代理以提高反馈质量。进一步拓展这种协作结构,此类系统的当前前沿是通过高级推理和模拟来复制更深层次的人类认知过程。这涉及整合多阶段推理、结构化分析框架和基于证据的论证,以近似达到人类专家所达到的批判深度。DeepReviewer 框架 (Zhu 等人)就是一个典型的例子。2025),它采用多阶段思维过程(分析、论证、评估),并已证明具有强大的性能和韧性 (Ye等人,2024同样,人工智能科学家 (Lu等人,2024)采用多轮反思来评估论文。通过将多智能体结构与先进的认知模拟相结合,这些系统正朝着“透明盒子”式的方法发展,在这种方法中,人工智能的思考过程更加清晰可辨、可验证,这对于在高风险的学术评估中建立信任至关重要。

5.2评估基准

AI审阅系统的进步和严格评估从根本上依赖于合适的数据集和基准的可用性。这些资源(Choudhary等人,2021李等人2022郭等人2023Purkayastha等人2023Bharti等人2024D'Arcy等人2024周等人2024bLou等人2025)既可作为评估模型的训练场,也可作为衡量其能力的标准(Zhuang et al.,2025早期数据集通常收集自会议或期刊评论记录 (Lin等人,2022曾等人2023周等人2024a随着该领域的发展,研究人员开始创建更多专业资源,以反映同行评审中涉及的不同任务。这包括专门用于评估相关性的资源(Couto等人,2024),回答问题的能力(Baumgärtner 等人,2025),方面引导的生成(Gao等人,2024)或针对弱点的反馈(Chamoun等人,2024),甚至包括检测人工智能生成的评论这一关键任务(Yu等人,2025翁等人2025表 3总结了 AI 审阅者评估的关键数据集和基准信息,提供了可用资源的概览。

5.3目前的AI科学家系统还不够好。

表4: 对各种人工智能科学家系统生成的AI论文进行评估。分数代表DeepReviewer-14B  (Zhu等人)给出的平均评分。2025)按可用论文数量(“Num”)划分。“百分位数”列显示每个系统的相对质量排名。注意:公开可用的论文可能经过筛选,因此可能无法完全代表每个系统的典型输出。

人工智能科学家系统数字健全性推介会贡献等级百分位数AI科学家 (Lu等人,2024)102.081.801.753.358.22%HKUSD 人工智能研究员 (Jiabin et al.,202571.751.461.572.573.43%AI Scientist-v2  (Yamada 等人,2025)31.671.501.502.332.04%CycleResearcher-12B  (Weng等人,202562.251.752.133.7516.88%Zochi  (本体论,2025)22.382.382.254.6329.96%

表5:在评估的 28 篇论文中发现了 12 个主要缺陷类别。

缺陷类别 数字 百分比
实验弱点 28 100%
方法论上的不清晰/缺陷 27 96.4%
写作与表达问题 26 92.9%
新奇之处 25 89.3%
理论上的弱点 24 85.7%
文献综述的不足之处 22 78.6%
实用性和稳健性差距 21 75.0%
可复现性问题 20 71.4%
计算成本问题 18 64.3%
成分分析 16 57.1%
缺乏超参数分析 16 57.1%
缺乏伦理考量 3 10.7%

在开创人工智能科学家系统 (Yamada等人)的同时,2025本体论,2025尽管这些工具展现出了诸如生成研讨会接受稿件等能力,但我们仍对其进行了严格的评估,结果显示它们在科学严谨性方面存在持续的缺陷。为了量化这些差距,我们采用了 DeepReviewer-14B  (Zhu 等人,2025我们使用一种先进的人工智能评审模型,对5个领先的人工智能科学家系统生成的28篇公开发表的研究论文进行评估。尽管公开发表的论文可能更有利于高质量的成果,但这项分析揭示了当前自主研究的系统性局限性。评估结果汇总于表 4,呈现出令人担忧的局面:评分最高的系统平均得分仅为4.63分(满分10分),大多数系统的得分远低于此。这些低分反映出在关键指标(包括可靠性、表达和贡献)上的糟糕表现。此外,评估结果还指出了被评估论文中存在的12个主要缺陷类别(表 5),其中“实验缺陷”在所有论文中均有出现。这一普遍存在的缺陷凸显了当前人工智能科学家系统在实现能力方面的严重不足,尤其是在实验设计、执行和结果分析方面。

其他普遍存在的问题包括“方法论不清晰/缺陷”(96.4%)、“写作和表达问题”(92.9%)以及“创新性问题”(89.3%)。这些发现表明,当前的AI科学家系统不仅在科学执行方面存在困难,而且在清晰阐述其研究成果方面也存在问题。“理论薄弱”(85.7%)和“文献综述不足”(78.6%)的高发生率进一步表明,这些系统往往无法提供真正原创的贡献,也无法将其论点建立在稳健的理论框架之上。这些评估结果与表 4中呈现的低量化得分相符,清楚地表明,尽管当前的AI科学家系统技术先进,但它们无法独立生成符合高质量科学交流既定标准的科学成果。 这些发现强烈表明,当前AI生成的研究往往缺乏有意义的自主研究和可信的科学贡献所应具备的深度、严谨性和实施质量。通过进化机制解决这些局限性,对于推动人工智能科学家系统充分发挥其作为自主科学代理的潜力而言,是必要的。

6进化

Definition: Evolution is the capability to continuously advance overall research abilities based on feedback from internal reflection or external inputs. This capability involves the dynamic planning for research directions and the autonomous learning for improvement, serving as the pathway for an elementary AI Scientist to evolve into a mature scientific agent.

人工智能领域已经涌现出一些有影响力的著作 (Lu等人,2024翁等人2025本体论,2025山田等人2025例如,AI Scientist-v2  (Yamada等人,2025人工智能能够自主生成论文,并在主要机器学习会议的研讨会上成功通过同行评审。尽管取得了显著进展,但大量的定量证据(表 2、4、5表明当前人工智能生成的研究在科学严谨性和实施质量方面仍然存在系统性问题,人工智能科学家距离能够做出突破性发现、解决医学、能源和环境等领域的重大挑战,从而改变世界并重塑科学研究范式,仍然存在相当大的差距。我们将这一差距归因于:(1)人工智能科学家所依赖的基础模型(即机器学习模型)的固有局限性;(2)当前人工智能科学家科学研究能力的不足,例如提出可行性低的假设、采用不正确的验证方法以及理解和分解复杂研究任务的能力有限。关于这一差距的更详细讨论将在第 7节中展开。

通过持续演化,初级人工智能科学家可以逐步弥合这一差距,并逐渐接近成熟科学主体的能力。具体而言,演化机制使人工智能科学家能够超越其初始基础模型的静态限制,并通过与人类专家和动态科学环境的迭代反馈和交互来提升其研究能力,从而朝着自主、可靠和创新的科学发现的长期愿景迈进。在本节中,我们将重点讨论演化能力所需的关键技术,包括动态规划研究方向的策略和自主学习 方法(Schmidhuber,2007这些基础技术对于弥合当前人工智能科学家系统与做出变革性发现之间仍然存在的差距至关重要。

6.1方法

目前,人工智能科学家领域的大多数研究都侧重于单个科学成果(例如科学假设或实验代码实现)的演化,而非通过全面的规划和迭代来管理长期的研究周期。本节主要概述现有人工智能科学家系统如何进行演化,具体包括它们在规划演化路径(  6.1.1节)和采用自主改进(  6.1.2节)方面的方法。关于长期研究迭代和全面规划的讨论将在第 8节进行。

6.1.1动态规划

动态规划能力旨在探索受限搜索空间内最有价值的研究方向,使人工智能科学家能够高效地分配资源、确定假设的优先级,并根据持续的结果和反馈自适应地改进研究路径。目前,在人工智能科学家领域,动态规划仍相对欠发达,仅有少数前沿研究采用基于逻辑逻辑模型(LLM)的树状搜索策略,以实现对各种科学假设的结构化探索 (例如,Intology、2025)和详细的实验计划 (Jansen等人,2024山田等人2025袁等人2025例如,当给定一个广泛的研究领域时,Zochi  (Intology,2025)执行一个全面的探索和改进过程,其中它生成多个候选假设,设计实验来测试这些假设,并根据结果迭代地改进其策略。在AI Scientist-v2中,   Yamada 等人(2025本文引入了一个实验管理代理,并结合一种新颖的代理树搜索算法来生成和优化代码实现。后续实验利用树搜索中性能最佳的代码检查点,迭代地评估各种研究假设。尽管这些方法能够发现更高质量的科学假设和实验设计,但它们仍然面临着诸如复杂性增加、计算成本更高以及可扩展性有限等挑战 (Jansen等人,2025)。

6.1.2自主学习

为了不断提升人工智能科学家的整体研究能力,人们采用了多种自主学习策略。根据反馈来源的不同,这些方法可以分为自我反思方法和外部指导方法。

自我反思方法 (Lu等人,2024Romera-Paredes等人2024翁等人2025Jansen等人2025山田等人2025Novikov等人2025)指的是学习学习模型(LLM)作为自身反馈提供者,迭代地评估和改进其输出,直到达到一定的质量标准的过程 (Madaan等人,2023Pan等人2024a)。这种持续自我改进的理念已被LLM广泛采用,以提高下游绩效 (Weng等人,2022Zelikman等人2022)并减少有害反应 (Bai等人,2022因此,在人工智能科学家领域,研究人员也开始采用自我反思策略来提高所生成科学成果的质量。例如,Weng等人(2025本文提出了一种迭代偏好训练框架,该框架由两个组件构成:(1)CycleResearcher,用于执行研究任务;(2)CycleReviewer,用于模拟同行评审过程,并通过强化学习提供迭代反馈。整个过程通过迭代不断改进,每次迭代都会逐步提升研究能力。DeepMind 的 FunSearch  (Romera-Paredes 等人,2024遵循类似的演化范式,将预训练的逻辑推理模型(LLM )与系统评估器相结合。LLM 的任务是为科学问题生成创造性的解决方案,而评估器则负责防止虚构和错误推理。它迭代地对表现最佳的代码程序进行采样,并将它们融入新的提示中,供 LLM 构建,从而将最初得分较低的程序演化为表现较高的程序,进而发现新的见解。

外部引导方法 (Yuan等人,2025Yu等人2024施密德加尔和穆尔,2025Jansen等人2024对人工智能生成的成果进行外部评估也是一种重要的反馈形式。目前的人工智能科学家系统通常采用两种方法:(1)在生成过程中引入人工监督,以评估假设的质量并提供简要的修改建议 (Jansen等人,2025本体论,2025);(2)利用基于互联网的学术平台(例如,Semantic Sc​​holar  (Fricke,2018))过滤掉与现有文献过于相似的假设,从而确保新颖性 (Yuan等人,2025Lu等人2024翁等人2025除了这些方法之外,一些研究致力于构建完全由人工智能科学家系统组成的科研社区,并通过协作提高其产出质量。例如,Yu等人(2024)介绍了 RESEARCHTOWN,一个用于模拟研究社区的多智能体框架。RESEARCHSTOWN 将研究社区建模为一个“智能体-数据图”,其中人工智能研究人员和论文被表示为节点,而阅读、写作和评论等活动则被实现为 TextGNN 推理框架内的消息传递操作。类似地,WestlakeNLP(2025建立AiraXiv平台,这是一个集中式平台,用于存档人工智能科学家系统生成的科学成果,使它们能够协作、分享见解并相互迭代地改进彼此的工作。然而,目前该领域缺乏专门用于科学家之间交流的协议,以促进人工智能科学家系统之间更高效、更结构化的交互。这样的协议可以规范交互工作流程并定义通信格式,最终促进人工智能科学家系统之间有效的协作和信息交换。因此,开发人工智能科学家系统的专用通信协议是推进自动化科学发现的关键未来方向(详见第 8节)。

7讨论

表6:对基于LLM的科学代理、科学工具和人工智能科学家相关综述论文的比较。研究范围:每篇综述论文的研究领域;伦理/社会:对伦理和社会问题的讨论;能力路线图:是否提供了迈向成熟人工智能科学家的分阶段路线图;关键差距评估:论文是否对迈向成熟人工智能科学家的进展进行了批判性评估并指出了瓶颈。✔:覆盖面广/独特;△:部分/相关承保;✗:承保范围很小或没有承保。

民意调查 研究范围 伦理/社会 能力路线图 关键差距评估
张等人(2024b 科学法学硕士
任等人2025 基于LLM的科学代理
Gridach等人(2025 用于科学发现的智能体人工智能
郑等人。2025 科学法学硕士
周等人(2025b 人工智能驱动的研究支持系统
Luo等人2025 科学研究法学硕士
戈亚尔(2025 人工智能科学家
我们的 人工智能科学家

7.1本次调查的定位

尽管之前的调查已经提供了关于LLM架构、代理框架和用于自动科学发现的科学自动化工具的宝贵概述 (Zhang等人,2024b,郑等人,2025任等人2025周等人2025b戈亚尔2025Luo等人2025尽管如此,仍然存在一个关键缺口:缺乏一个全面描绘理想人工智能科学家发展路径的、基于能力的路线图。我们的调查通过引入一个能力级框架(图 1 )来弥补这一缺口,该框架系统地定义了人工智能科学家发展的各个阶段,为下一代人工智能驱动的科学发现设定了明确的基准。我们运用这一能力框架对当前的研究进行了批判性分析,识别出实现理想科学主体的关键瓶颈和缺失要素。我们的调查与现有调查论文之间的差异如表6所示 。

7.2 当前人工智能科学家在科学发现方面的局限性

尽管人工智能科学家系统领域取得了显著进展,但距离人工智能科学家成长为能够做出突破性发现、从而改变世界并重塑科学研究范式的科学主体,仍然存在相当大的差距。这种持续存在的差距可归因于几个关键因素。首先,支撑人工智能科学家系统的基础模型(即语言学习模型,LLM)固有的局限性构成了重大障碍。这些模型虽然在语言理解和生成方面展现出令人印象深刻的能力,但往往缺乏深厚的领域专业知识、科学推理能力以及做出高影响力科学突破所需的细致判断。它们的输出受到训练数据中编码的知识的限制,而这些数据可能已经过时、不完整,或者与科学界的最新进展不完全一致。其次,当前的人工智能科学家系统在几个关键方面表现出科学研究能力的不足。例如,它们可能生成缺乏可行性或新颖性的假设,应用不恰当或不充分的验证方法,并且难以深入理解和分解复杂的科研问题。这些缺陷不仅限制了人工智能生成的科学成果的可靠性,而且阻碍了人工智能科学家系统独立推进科学前沿的能力。

7.2.1基础模型的根本局限性

尽管LLM取得了显著进展,但作为AI科学家系统基础的LLM仍存在一些固有的局限性,包括幻觉、知识更新成本高昂且效率低下,以及灾难性遗忘。这些挑战严重制约了当前AI科学家系统的科学实用性和可靠性,因此,解决这些问题对于推进AI驱动的科学研究至关重要。

幻觉。在科学研究中,精确性、事实准确性和可靠性至关重要。然而,LLM 容易出现“幻觉”,即模型生成听起来合情合理但实际上错误或无法验证的内容 (Huang 等人,2025b张等人2025这可能以多种方式表现出来:(1)模型可能捏造研究结果、实验数据、参考文献,甚至完全不存在的理论,并将其呈现为事实。(2)人工智能生成的引文、数据和公式通常不可靠或来源不当,使得人类研究人员难以追踪和验证信息的来源和有效性。(3)幻觉输出可能包含细微的逻辑矛盾或与上下文不符的论断,这会误导研究人员,损害科学成果的可信度,并最终削弱人们对人工智能生成的科学成果的信任。解决幻觉问题仍然是在高风险科学环境中部署基于LLM的AI科学家系统所面临的最重大挑战之一。

知识更新成本高昂且效率低下。 前沿科学研究进展迅速,要求人工智能科学家系统不断整合最新发现和数据。然而,保持知识层级模型(LLM)的更新并非易事:(1)新的科学文献和数据量巨大,将这些信息整合到LLM中需要大量的计算资源、存储空间和时间。(2)频繁地对大规模模型进行重新训练或微调既耗时又费力,这往往会导致知识整合的延迟,使模型在快速发展的研究领域中过时。(3)缺乏高效、细粒度和持续的学习机制意味着知识更新过程通常很慢,导致科学领域的最新进展与人工智能科学家系统中编码的知识之间存在持续的滞后。

灾难性遗忘。 另一个根本性的挑战是灾难性遗忘,即神经网络在用新数据训练时容易丢失先前获得的信息 (Kirkpatrick等人,2017对于人工智能科学家而言,这一挑战意味着,尝试用新的科学知识更新模型可能会无意中覆盖或削弱其对现有科学概念、方法和事实的理解。这种不稳定性会削弱系统长期维护全面连贯的科学知识体系的能力。因此,整合不同时期和不同科学领域的研究成果变得尤为困难,进而损害了基于LLM的人工智能科学家系统进行纵向分析、将历史洞见与新兴发现联系起来以及为复杂的科学探索提供持续可靠支持的能力。

7.2.2人工智能科学家系统研究能力的局限性

当前人工智能科学家系统的研究能力在几个关键方面仍然存在局限性。这些局限性不仅限制了它们在支持和自动化科学研究方面的有效性,也制约了它们独立推动重大科学突破的潜力。下文我们将通过所提出的能力框架(图 1)来探讨核心能力差距。

知识获取。 从浩瀚且快速增长的科学文献中获取、组织和内化知识的能力是人工智能科学家的基本能力。这不仅包括搜索和检索相关论文和结果,还包括提取核心思想、整合实验细节以及将分散的研究结果整合为连贯的理解。然而,现有的人工智能科学家系统在这一领域面临着几个重大挑战,其中包括:(1)信息检索的精确性。科学文献的庞大规模和多样性使得当前的人工智能科学家系统难以针对给定的研究问题准确检索到最相关、最新的信息 (Landhuis,2016他们经常难以准确解读复杂或模糊的查询,有效筛选高度相关的文档,并确保检索结果的及时性和可靠性。检索的精确率和召回率都需要进一步提高,以达到科学标准。( 2) 多文档摘要和综合。生成准确全面的文献综述不仅需要检索多个相关文档,还需要综合不同来源的信息,解决不一致之处,并生成准确的摘要 (Agarwal 等人,2024a近年来,诸如 RAG 和基于计划的摘要等方法在这方面取得了进展。然而,研究表明,LLM仍然容易错误引用或歪曲原始资料 (Agarwal 等人,2024b这表明,在总结来自多个文档的科学知识时,语义理解、信息整合和事实准确性方面仍然存在挑战。

创意生成。科学研究​​最关键的方面之一是生成新颖且可行的科学假设。尽管取得了显著进展,但创意生成能力仍然受到以下几个方面的严重制约:(1)难以生成高质量的假设。生成既新颖又可行的科学假设是一项复杂的任务,需要对现有知识有深刻的理解,并具备识别创新联系的能力。然而,经验证据表明,当前的AI科学家系统在这方面往往存在不足。具体而言,这些模型产生的想法往往缺乏真正的原创性,并且在不同的运行甚至不同的模型之间经常重复出现 (Lu等人,2024造成这种现象的根本原因有二:首先,LLM(逻辑逻辑模型)从根本上受限于其训练数据,这限制了它们超越既有概念框架的能力。其次,由于缺乏先进的知识整合或创造力机制,AI科学家系统往往过度依赖表面的文本关联,而非产生真正具有科学创新性的想法。这不仅导致输出结果重复,也限制了突破性发现的可能性。(2) 评估AI生成的科学假设质量的挑战。另一个限制源于可靠评估AI生成的科学假设的质量和潜在影响的挑战。与具有明确评估标准的标准化任务不同,科学假设的价值通常是主观的、依赖于具体情境的,并且难以量化。目前的评估方法严重依赖于人类专家的判断,这不仅耗费资源,而且容易受到主观性和不一致性的影响。近年来引入自动化评估器的尝试在一定程度上有所帮助,但这些系统本身也继承了其底层模型的偏差和知识局限性。因此,缺乏可靠、客观和可扩展的人工智能生成假设评估框架,仍然是人工智能科学家系统在现实世界研究环境中取得进展的瓶颈。

验证与证伪。如第4节所述 ,验证与证伪是一项复杂的能力,需要通过实验设计、执行和验证来严格验证假设并可能证伪假设。对于人工智能科学家系统而言,这一过程在技术上要求很高,在操作上也很复杂,尤其是在考虑集成多智能体框架以及与外部工具或人类研究人员协作时:(1)多智能体协作。 在现代研究环境中,有效的协作,无论是与其他人工智能智能体、人类科学家还是各种外部工具的协作,对于科学进步都至关重要 (Guo 等人,2024钱等人2024Pu等人2025人工智能科学家不仅应该理解协作协议和劳动分工,还应该能够可靠地与不同的利益相关者协调,执行分配的任务,并将输出结果整合回更大的研究工作流程中 (Bo等人,2024张等人2024c然而,目前的AI科学家系统在鲁棒性、适应性和容错性方面仍然存在显著缺陷,尤其是在动态或不可预测的环境中 (Wei等人,2025例如,他们在与不断变化的外部 API 交互、处理错误消息或管理并发任务时经常遇到困难,而这些对于现实世界的科学自动化都至关重要 (Shen 等人,2025(2)实验设计、执行和验证。验证和证伪能力的核心在于实验设计、执行和验证。然而,当前的AI科学家系统在这些阶段面临诸多挑战。首先,它们自动生成的实验设计往往 缺乏科学严谨性、创新性和实用性,难以满足前沿研究的需求。此外,这些系统倾向于依赖静态模板和狭窄的文献集,限制了它们整合最新技术进展和实验方法的能力。因此,最终的实验方案往往与研究前沿脱节,缺乏实际应用价值 (Weng等人,2025本体论,2025此外,如表2中的经验证据所示 ,人工智能科学家在将概念理解或初始计划转化为可验证的正确且可执行的代码时会遇到重大困难。例如,在诸如 SciReplicate-Bench 等最先进的基准测试中 (Xiang 等人,2025),其最佳执行准确率仅为39%,这凸显了其执行和验证能力的根本局限性。

演化。人工智能科学家持续演化的能力对于科学创新至关重要。然而,当前的人工智能科学家系统在演化能力方面存在显著局限性,阻碍了其长期发展和适应性:(1)动态规划是指系统自适应地探索新的研究方向、更新假设并迭代改进实验策略的能力。尽管动态规划至关重要,但现有人工智能科学家系统仍未充分发展这一能力。近期研究引入了基于树搜索的策略。虽然这些策略代表着向前迈出的重要一步,但它们仍然受到多种因素的限制:算法复杂性增加、计算开销巨大以及难以扩展到大规模科学问题。随着可能的研究路径数量的增长,现有方法难以有效地平衡探索和利用,往往导致假设质量和资源利用率双双下降。(2)自主学习。演化的一个关键组成部分是从反馈中学习的能力,无论这些反馈是来自内部的自我反思还是外部来源。然而,当人工智能科学家仅依赖内部反思产生的自我反馈时,它们容易陷入“循环错误”,这意味着错误会在多次迭代中被放大,而不是被纠正或改进。如果没有有效的、稳健的自我批评机制,系统可能会陷入错误累积的循环,从而损害其研究成果的原创性和可靠性。虽然整合来自外部来源(尤其是其他人工智能科学家系统)的反馈对集体智能具有巨大潜力,但目前的框架缺乏科学家之间互动的标准化通信协议。缺乏稳健的协作机制会导致思想交流效率低下,外部批评的整合效果欠佳,使得人工智能科学家系统无法充分发挥智能体协作的潜力,从而减缓其发展速度 (Wang et al.,2025)。

7.3伦理挑战

人工智能科学家系统的出现从根本上重塑了人类研究的格局 (King等人,2009然而,作为自主研究代理,人工智能科学家系统无法对其工作的社会影响做出伦理判断,也不会根据其研究结果可能存在的风险进行自我调节 (Bengio等人,2025如果缺乏适当的监督,人工智能科学家系统可能会带来一系列伦理挑战,需要进行系统性的考量:

(1)人工智能科学家可能被滥用,导致同行评审系统不堪重负,进而降低整体研究质量。人工智能科学家系统快速、大规模地生成科学成果,可能会使现有的同行评审机制不堪重负,使人类评审员难以严格评估提交稿件的质量。这种超负荷运转可能导致低质量、错误或重复的论文进入科学记录,从而损害学术出版标准,减缓科学进步。此外,同行评审过程本身也可能通过诸如奖励操纵等手段被操控,进一步降低科学评价的公平性和客观性 (Lu et al.,2024)。

(2)人工智能科学家可能自主进入危险的研究领域,加速有害技术的发展。如果没有强有力的伦理约束,人工智能科学家系统可以独立生成并发表敏感领域(例如网络安全)的研究成果。这种不受控制的知识传播可能会加速潜在有害科学技术的开发和扩散,而此时可能尚未实施充分的伦理准则、安全协议或监管措施 (Huang et al.,2022)。

(3)人工智能科学家可能会削弱科学培训和教育的整体质量,导致各级研究人员的研究标准和科学素养下降。在整个研究和教育流程中广泛使用人工智能科学家系统可能会助长对自动化辅助的过度依赖,尤其是在诸如构思、实验设计、数据分析和假设检验等关键任务上。随着时间的推移,这种依赖可能会削弱批判性思维、创造力和实践研究技能,最终降低科学素养,并扩大不同机构之间在获取先进人工智能工具方面的差距 (Yamada等人,2025)。

(4)人工智能科学家可能会在科学研究过程中引入安全漏洞和研究偏差。例如,人工智能科学家系统可能使用与其预期设计不符的验证机制,导致难以检测且需要大量人工监督的误导性结果 (Jansen等人,2025这些问题不仅浪费了宝贵的研究资源,也降低了科学发现的可靠性。此外,人工智能科学家往往倾向于选择数据集丰富或自动化潜力高的研究课题,这可能会促使资助机构优先考虑这些领域。这导致研究经费分配不均,并缩小了整体研究范围 (Yamada et al.,2025资金充足的机构更有能力利用人工智能科学家系统,这进一步加剧了现有的不平等,并提高了早期职业研究人员的准入门槛。

为了应对这些风险,迫切需要建立一个全面的人工智能科学家 系统生成管理、伦理监督和质量评估体系(Jobin等人,2019该管理系统应包括但不限于以下组成部分:

(1)一个集中式平台,用于减轻对人工审阅系统的干扰。该平台存档人工智能生成的科学成果,并开发自动化检测工具(例如 DeepReview  (Zhu 等人,2025识别和过滤低质量内容。所有人工智能生成的输出都必须清晰标注其来源、生成方法和所使用的科学工具等信息。此外,由于作者身份意味着法律和伦理责任,而目前的人工智能系统无法承担这些责任,因此人工智能科学家系统不得被列为正式作者,并且必须确保法律和伦理责任得到妥善分配。

(2)明确区分人主导的研究活动和人工智能主导的研究活动,以保留必要的人类训练,并确保所有研究人员的全面发展。 科学教育和培训的关键阶段(例如,假设的提出和实验验证)应强调人的积极参与,以维护高标准的科学规范。教育机构和研究组织应制定明确的指导方针,防止从本科生到经验丰富的研究人员等各个层级过度依赖人工智能科学家系统,确保人工智能在教育过程中作为工具而非人类的替代品发挥作用。

(3)制定人工智能驱动研究中伦理边界和风险管理的全球公约,明确全球伦理和责任准则。必须全面披露生成过程、算法来源和潜在风险 (Huang et al.,2022此外,应建立一个结合自动化系统和人机交互审查的混合监督框架,以提供持续的伦理监督和风险评估,从而确保人工智能科学家系统的研究活动保持在社会可接受的范围内 (Jobin等人,)。2019Khan等人2022)。

8未来方向

在前几节中,我们回顾了人工智能科学家系统目前取得的成就(第 2节 至第 6节),并从基础模型缺陷和研究能力不足两个角度分析了它们的局限性(第 7节),重点阐述了我们目前所处的位置以及仍然存在的不足。在本节中,我们首先概述了弥合人工智能科学家系统现有差距的潜在方向,并探讨了其未来发展的可行路径。

8.1弥合当前差距的潜在方向

通过系统地解决基础性限制、全面管理长期研究工作以及开发强大的通信协议,未来的人工智能科学家系统可以逐步弥合现有差距,并充分发挥其作为科学发现变革力量的潜力。

解决模型的基本局限性并提升研究能力。 如前所述,当前人工智能科学家系统面临的一个重大瓶颈在于基础模型的固有局限性。诸如幻觉、知识更新效率低下以及灾难性遗忘等问题严重阻碍了其可靠性和科学严谨性。解决这些根本性限制需要在模型架构、训练方法和推理时验证策略方面取得重大进展。潜在的解决方案包括开发混合模型架构,将符号推理能力与深度学习架构相结合,以增强可解释性和事实准确性。此外,诸如RAG和持续学习框架等方法可以缓解与数据时效性和模型适应性相关的问题,确保人工智能科学家能够保持最新且可验证的科学知识。此外,通过进化机制提升人工智能科学家系统的研究能力 (例如,假设评估和科学推理)也至关重要。改进措施可能包括加入迭代偏好训练和结构化自我反思机制,使模型能够根据严格的内部批评和外部反馈自主地改进其能力。

管理长期研究周期。 成熟的人工智能科学家应能自主管理全面、长期的研究周期。然而,目前的人工智能科学家系统主要侧重于短期的个体研究任务。未来的人工智能科学家系统必须整合复杂的动态规划方法,例如分层规划框架智能体树搜索算法,才能有效地驾驭广泛的研究路径。此外,为了进一步促进迭代改进循环,人工智能科学家系统可以整合基于遗传算法的优化强化学习驱动的优化等框架。 这些机制有助于确定研究目标的优先级、高效分配资源,并根据不断深入的洞察自适应地改进策略,从而显著提升自主科学发现的深度和广度。

为人工智能科学家系统开发通信协议。 另一个关键的未来发展方向是开发标准化的科学家间通信协议(SSCP),以实现人工智能科学家系统之间结构化且高效的交互。目前,人工智能驱动的研究合作主要依赖于临时性的通信方法,因此缺乏标准化的交互工作流程和统一的通信格式。建立SSCP可以显著提升人工智能科学家的协作能力,促进有效的信息交流、假设验证和多智能体研究协调。此类通信协议应明确交互工作流程、结构化数据格式和协作研究策略,以促进异构人工智能科学家系统之间的无缝集成。利用这些标准化的通信协议可以进一步推动人工智能驱动的研究社群的形成,使集体智慧能够以前所未有的效率和严谨性应对复杂的跨学科研究挑战。

8.2人工智能科学家之路

与人类科学家不同,人工智能科学家系统通过自组织演进的方式发展,这种方式可能比人类的方法更独特、更高效。人类科学家通过正规教育、实践实验和伦理培训来积累知识,而人工智能科学家系统则通过集成诸如逻辑学习模型(LLM)、仿真引擎和机器人系统等专用模块来发展。这种模块化方法使人工智能科学家的开发更接近系统工程,有助于快速提升研究能力,并显著提高科研效率。此外,强迫人工智能科学家复制人类的发展路径可能会限制其潜力。人工智能系统擅长快速处理和分析海量数据集,使其能够在更短的时间内识别研究问题并制定解决方案。因此,人工智能科学家系统的开发工作应优先考虑发挥其内在优势(例如,跨学科知识整合),而不是复制人类科学家的发展路径。

在人工智能科学家发展的早期阶段,其未来发展路径可以沿着两个相互依存的范式进行设想:(1)为个体​​人类研究人员量身定制的个性化人工智能科学家系统,通过个性化的协同进化伙伴关系赋能于他们;(2)服务于更广泛的人类社会的人工智能科学家系统,加速全球解决方案的实现。前者旨在通过定制化的合作提升个体科学家的研究效率和创造力。与之相反,后者则致力于建立人工智能驱动的科学生态系统,有效应对复杂的全球挑战。这些路径共同指向一个愿景:人工智能科学家系统超越工具的功能,成为科学进步的积极推动者,在自主性和人类监督之间取得平衡,以维护诚信、包容性和社会效益 (Tsvetkova等人,2012)。2024)。

8.2.1面向独立研究人员的人工智能科学家

主动学习。 个性化人工智能科学家应积极获取经验、分析错误并吸收针对个体研究人员量身定制的最新知识。这包括:(1)知识缺口识别:通过审查研究人员的出版物、笔记和未解决的问题,识别其知识缺口。(2)个性化文献推荐:根据研究人员的具体研究兴趣、当前项目阶段和实验瓶颈推荐论文 (He et al.,2025)。(3)实时学习:对新兴文献进行实时总结 (Agarwal等人,2024a)并结合对不熟悉概念的语境化解释。

与人类研究人员的偏好相匹配。有效的匹配涉及将人工智能科学家系统的能力与人类的研究目标相匹配,包括但不限于:(1)价值驱动的假设生成:使假设提案与研究人员的研究偏好、风险承受能力和资源限制相匹配。(2)伦理边界管理:动态适应研究人员的机构规则、资助伦理和个人界限(例如,自动拒绝基因编辑等高风险主题)。(3)合作研究议程:与人类研究人员共同规划研究方向,同时考虑个人职业抱负和对做出有影响力的科学贡献的优先事项。

相互指导和共同演化。 个性化的人工智能科学家与人类研究人员通过持续的科学研究活动共同进步:(1)双向改进循环:人工智能科学家系统和研究人员通过相互反馈迭代改进科学成果 (Romera-Paredes 等人,2024)。(2)演化个性化:通过从人类反馈中进行强化学习来持续调整偏好 (Ouyang等人,2022其中, AI 科学家系统会适应研究人员不断变化的风格,在自主性(例如,自动验证)和人类监督之间取得平衡。

8.2.2为人类社会服务的AI科学家

适应科学发展的趋势。 服务于更广泛的人类社会的AI科学家必须动态地适应现代研究加速发展和跨学科性质的特点,具体措施包括:(1)持续的知识整合:高效地整合来自不同领域(例如生物信息学、量子计算)的新兴研究,同时防止先前知识的流失 (Kirkpatrick等人,2017(2)跨领域合作:通过跨领域方法转移(例如,将机器学习驱动的药物发现应用于材料科学)促进跨学科发现。(3)预测性研究:利用预印本库(例如,arXiv、bioRxiv)和资金趋势的网络分析,识别新兴科学趋势,引导研究重点关注气候适应力或疫情应对等关键议题。

人类发展的前景。 人工智能科学家系统可以通过以下方式极大地促进人类进步:(1) 通过提供开放获取的工具和基于云的实验模拟器来缩小资源差距,使资源匮乏的机构能够参与全球研究。(2) 通过自动化实验加速解决关键挑战(例如,可再生能源、疾病治疗)。早期的成功案例包括 ChemCrow  (Bran 等人,2023)和 BioDiscoveryAgent  (Roohani 等人,2024这些系统在化学/生物学领域展现出应用前景。随着这些系统与物理实验室(例如物联网传感器)的接口日益增多,它们有望发展成为支持全周期科学工作流程的工具。

9结论

本文对人工智能科学家系统领域的现有研究进行了系统性综述,全面概述了该领域的进展。具体而言,我们提出了一个能力层级框架,将人工智能科学家的能力划分为四个递进的层级:知识获取、创意生成、验证与证伪以及演化。基于此框架,我们对现有研究进行了批判性分析,并着重指出人工智能科学家系统在取得突破性发现、解决医学、能源和环境等领域的重大挑战之前必须解决的差距,从而改变世界并重塑科学研究范式。最后,我们总结了未来发展方向,概述了弥合差距、推动该领域迈向真正自主科学智能的关键所在。

参考

  • Agarwal 等人 (2024a)Shubham Agarwal、Gaurav Sahu、Abhay Puri、Issam H Laradji、Krishnamurthy DJ Dvijotham、Jason Stanley、Laurent Charlin 和 Christopher Pal。Litllm:科学文献综述工具包。arXiv 预印本 arXiv: 2402.01788,2024a。
Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐