打开网易新闻 查看更多图片

新智元报道

打开网易新闻 查看更多图片

我们如何判断人工智能是否已经足够聪明,能够从事科学研究,实现端到端的自主科学发现?

中国科学技术大学发布的最新研究让AI「大脑」接管机器科学家实验室「身体」,由此将这一问题从知识问答和方案生成,推进到真实物理世界中的实验执行与反馈学习。

打开网易新闻 查看更多图片

论文链接:https://arxiv.org/abs/2607.23045

研究团队搭建了一个机器催化实验室,其中包括45个覆盖合成、表征和催化性能测试的模块化自动工作站。

为了让AI理解和调用实验室能力,研究团队将这些能力封装为机器可读技能(skills)。AI智能体可以通过这些技能直接调用实验设备,同时接受真实设备能力、操作规范和实验条件的约束。

打开网易新闻 查看更多图片

图1.用于催化研究的AI读得懂的机器科学家实验室架构。

打开网易新闻 查看更多图片

图2.从科学意图到机器实验室执行路径。

压力测试

基于该平台,研究团队对由6种智能体框架和9种大语言模型构成的48种实际配置进行了系统评测。

测试覆盖32项由领域专家定义的研究任务,共计4,608次评测试次。评估不仅考察智能体能否生成实验计划,还追踪这些计划能否通过核验并下发至机器人系统,以及生成的工作流是否能够在无需人工干预的情况下直接执行。

残酷的真实世界评测结果

当前领先的大语言模型智能体距离「接管」仍有明显差距。在4,608次测试中,仅151个工作流无需人工修复即可执行,占全部测试的3.3%。表现最好的Claude Code与Claude Opus 4.7组合,可执行率为28.1%;Codex与GPT 5.5组合的可执行率为19.8%。

会调整参数,不等于会重新规划

研究还进一步考察了智能体能否从真实实验结果中学习。团队将Codex/GPT 5.5的组合置于一个开放式的五轮闭环中,连续开展实验规划、机器人执行、证据获取和重新规划。

智能体能够根据返回的实验结果调整材料配方和操作条件,但这些调整主要停留在局部参数优化层面。

在五轮实验过程中,智能体始终保留原有的工作流骨架,没有重新设计分析方法,也未能纠正一些持续存在的关键遗漏,例如缺少电极黏结剂和针对特定分析物的显色试剂。

结果表明,能够读取实验反馈并调整参数,并不等同于能够识别研究策略本身的问题,更不等同于进行科学层面的重新规划。

打开网易新闻 查看更多图片

图3.AI智能体在可执行规划、验证和实验室任务下发各环节的表现。

长程规划仍然是瓶颈

虽然部分智能体生成了经专家评估可执行、且最多包含44个操作步骤的工作流,但在全部测试中,只有3个工作流超过30个操作步骤。这表明,随着任务链条延长,智能体维持实验逻辑完整性和物理可执行性的能力仍面临显著挑战。

重新定义AI的科学能力

研究由此区分了当前「AI科学家」讨论中经常被混为一谈的三种能力:一是流畅地生成实验计划,二是生成能够在物理实验室中实际执行的工作流,三是根据实验结果调整整体研究策略。

研究结果显示,语言层面的规划能力并不能自动转化为可靠的实验执行能力,局部参数调整也不能被直接视为科学层面的重新规划。

从「AI测试场」走向「AI训练场」

作为AI for Science的智能科研基础设施,机器实验室既可以成为检验AI科学能力的「测试场」,也可以成为推动AI持续进化的「训练场」。AI智能体通过机器可读技能与机器实验室直接对话,将科学意图转化为可执行任务,并接收来自机器执行、仪器状态和实验结果的真实反馈。

由此形成的「规划—执行—反馈—重新规划」闭环,不仅能够暴露AI在知识、操作和研究策略层面的缺陷,还可以将成功的工作流、失败案例、实验结果和专家评估沉淀为模型训练与智能体对齐的数据,持续迭代AI模型及其智能体系统。

机器科学家由此为回答「我们如何判断人工智能是否已经足够聪明,能够从事科学研究?」提供可量化、可重复、可验证的物理世界证据,并推动AI从生成实验方案,逐步走向涵盖科学问题提出、实验设计、机器人执行、数据分析和证据驱动重新规划的端到端自主科学发现。

打开网易新闻 查看更多图片

图4.开放科学问题下AI-机器科学家的五轮迭代。

参考资料:

https://arxiv.org/abs/2607.23045

编辑:LRST