近日,普林斯顿大学研究团队在预印本平台 arXiv 发布了一项尚未经过同行评审的研究,通过「影子评估」检验 AI 自主开展计算机科学研究的能力。
团队基于大型语言模型 Claude Opus 4.8 构建智能体系统,令其拥有六天时间和 3000 美元计算额度,可访问互联网、软件库、运行实验的处理器及模拟同行评审工具。结果显示, AI 系统在工程执行上能连续运行数百次实验而不陷入错误循环,完成扎实文献综述并发现自身虚假主张,但在研究创造力和任务执行上严重不足。
典型失败模式为过早选定假设,方法不奏效时未能充分回溯,自我评审不够负面,导致最终产出缺乏实质内容。其在两篇 NeurIPS 会议论文的对应任务中表现不佳,原始论文作者给出的总体评分分别为 2/6 和 1/6 。系统开发者认为,若给予更受约束的「驱动框架」则部分问题可以轻松解决,并指出 AI 在狭窄任务上已有改进,但尚未准备好产生原创见解,更缺乏「研究品味」,即缺乏判断哪些问题值得研究的能力。
来源:《自然》新闻
打开网易新闻 查看更多图片

