Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

如果你在做 coding agent,或者关心"模型到底是会解题还是会发现",这条值得停下来看一眼。NatureBench 想回答的不是"智能体能不能复现一篇论文的代码",而是更狠的一问:把真实的前沿科学问题摆在它面前,它能不能超过人类已经发表的最好结果。答案目前是:基本不能。 先说它为什么挑 Nature 系列论文。这类工作经过同行评议、有明确的已发表 SOTA 作为标尺,把它们蒸馏成任务,就等于给智能体设了一道"人类专家已经做到这个分数,你能不能更高"的硬门槛——这比让模型在合成题或刷过的公开榜上自证要诚实得多。NatureBench 一共收了 90 个任务,跨多个学科,定位是评估智能体"能否越过复现、走向发现"。 支撑这套评测的是 NatureGym,一条自动化流水线,能从一篇源论文出发,为每个任务搭出标准化、单任务隔离的容器环境。这一步看着像工程细节,其实是要害:此前"让智能体做科研"的基准长期被环境碎片化拖累——每个任务依赖、数据、运行方式都不一样,跑不通或跑不一致,结果自然没人信。把环境标准化、容器化,是让这类评测可信、可复现的前提。 评测设定也刻意收紧。作者在禁止联网搜索的严格协议下,测了十种前沿智能体配置——断网是为了逼模型真用自己的能力解题,而不是把答案搜出来。结果是:最强的那一个配置,也只在 17.8% 的任务上超过了已发表 SOTA,判定标准是效应量 g>0.1(即相对基线要有可观察的实质提升,而非擦边)。换句话说,十个里有八个多的科学任务,当前最强的智能体配置都没能做得比人类已发表的更好。 更有意思的是失败的"姿势"。作者顺着方法路径做了分析,发现智能体之所以偶尔能过关,多半靠的是"方法翻译"——把一个科学任务硬掰成自己熟悉的监督预测问题来做,而不是真正想出新的科学方法。而失败的主因,是选错了方法、以及算力预算不够,并不是没读懂任务。这个区分很关键:它说明瓶颈不在"理解力",而在"科学判断力"和"资源约束"——智能体看得懂题,却不知道该用哪条路去解,也跑不起足够大的实验。 对从业者意味着什么?如果你在评估 coding agent 用于科研自动化的真实上限,这条基准提供了一个比代码复现严苛得多的标尺,也提醒别把"能复现"误当成"能发现"。作者把基准、NatureGym 流水线、以及带维护方复现的公开榜单都放出来了,可以直接拿去对自己的智能体配置做评测。 诚实的保留:原文给出的是十种配置、90 任务、17.8% 这几个核心数字,但没有在本条素材里点名具体是哪些模型、各自得分多少、覆盖哪些具体学科,这些细节原文未在此处给出,需要查正文与榜单。这是单篇 v1 预印本的自报评测,跨学科任务的难度分布是否均衡、g>0.1 这个阈值卡得是否合适,也都还要等第三方复核——它放出了维护方复现,至少给了核验的入口。