← 返回博客
Ai预计阅读 9 分钟

前沿智能体完成了30%的研究工作流。这就是那个数字。

发布于 2026年10月4日
前沿智能体完成了30%的研究工作流。这就是那个数字。

斯坦福大学发布了一个名为 Terminal-Bench-Science 0.1 的新基准,而最引人注目的结果远不如围绕智能体的营销宣传那么令人兴奋。该基准将70个由专家编写的研究工作流摆在最前沿的智能体面前。表现最好的一个完成了其中30%。

30% 这个数字需要记住。它既谈不上失败,也谈不上胜利。它是由手工编写这些任务的人发布的、对这项技术当前所处位置的诚实测量。

这个基准实际测试什么

这些任务是由领域专家编写的科研工作流,智能体在终端中运行。这一选择很重要。终端是一个让任务变得真实的工作环境:你必须真正安装依赖项、写入文件、运行分析并检查输出。描述出正确方法并不会得到部分分数。命令要么有效,要么无效。

这些工作流取自研究实践,而研究实践比带有整洁测试套件的编程任务要混乱得多。编程基准通常有定义明确的正确答案,因此可以自动评分。研究工作往往没有,这就是为什么构建这样的基准需要专家手工编写任务,而不是从代码仓库中提取。

为什么30%是正确的理解框架

基准测试往往被解读为通过或失败。在编程基准上得分90的模型会被视为接近解决。以同样的精神,完成30%研究工作流的模型可以被解读为大多数时候都在失败。

这种解读忽略了这个数字的用途。在手工编写的专家任务上完成30%,意味着智能体能够处理研究工作中常规的那三分之一:搭建环境、运行既定流程、清理数据、生成标准输出。另外70%则属于任务需要工作流未明确说明的判断力,或者某个步骤以需要人类决定下一步怎么办的方式中断的情况。

这是一个有用的划分。它告诉实验室今天该把智能体用在哪里,也告诉工具开发者缺口在哪里。

终端才是有意思的部分

在终端中运行智能体是一个刻意选择,目的是在工作实际发生的地方测试它们。科研软件主要是命令行软件。一个只能操作聊天窗口的模型对实验室没有帮助。一个能坐在 shell 前、阅读文档、安装工具链,并在构建失败时恢复的模型,属于另一类有用之物。

这也是失败模式最明显的地方。终端不会隐藏错误。当一条命令返回含糊的消息,或者脚本只完成了一半时,智能体必须决定是重试、改变方法,还是停止。这个决策点正是大部分70%损失的地方,而这恰恰是带有干净测试套件的编程基准永远不会暴露的问题。

不锈钢工作台上的实验室玻璃器皿,背景是模糊的深色屏幕

这与编程基准有何不同

显而易见的比较对象是编程基准,它们已经成为宣传智能体进展的标准方式。编程基准通常附带一个代码仓库和一个测试套件,因此正确答案是定义好的,分数也是自动的。这使其运行成本低、易于比较,也正是那些数字主导讨论的原因。

研究工作流则抗拒这种处理方式。通常没有唯一正确的输出,结果的质量取决于对测量什么以及如何测量的判断。这就是为什么这里的任务由专家编写,而不是从代码仓库中抓取,也是为什么该基准报告的是完成率,而不是测试通过率。

这种权衡是用覆盖范围换取现实性。编程基准可以每天运行数千次,并产生一个紧密的数字。工作流基准更慢、噪声更大,但它测试的是大量技术工作实际发生的环境。两者都有用,而在此之前只有其中一种被广泛使用。

为什么用这种方式衡量这个数字

完成率是一个生硬的指标,作者们是故意选择它的。一个工作流要么完成,要么没有完成,而这是一个外部观察者无需判断结果质量就能核实的事实。优雅不计分。正确性不争论。智能体要么产出了工作流所要求的输出,要么在某个地方提前停住了。

这种生硬正是关键。试图对开放式研究任务的质量进行评分的基准,往往会坍缩成基准作者的品味。通过给完成情况评分,这个基准用细微差别换取了可复现性。两个实验室运行同一个工作流会得到同样的答案,这才使一个数字值得被引用。

代价是它无法区分一个几乎完成的智能体和一个立刻失败的智能体。两者都算失败。这是一个局限,未来版本可能会解决它,但一个人人都同意的粗略数字,胜过一个人人都不信任的精细数字。

这个结果对科学工作说明了什么

这个基准是对一个响亮主张的安静回应,即智能体很快将从事研究。它表明的是,智能体可以运行研究,意思是它们可以在越来越多的常规步骤中执行人类已经设计好的流程。它们还不能做流程未知、需要有人去发明的那部分。

这个差距不是一个小小的工程细节。常规工作占用了科学家大量时间,将其自动化能节省真金白银和大量时间。它也不是产生发现的那部分。对于任何预测未来几年 AI 将对科学产生什么影响的人来说,这一区分都很重要。

如何解读这样的基准

任何新基准都适用两点提醒。第一是版本号。这是0.1,意味着随着作者们了解哪些任务表述得当、哪些任务含糊不清,任务集将会变化。不同版本的分数不能直接比较。

第二是基准衡量的是其作者选择的工作流。来自科学领域的70个任务是一个样本,而不是一次普查。30%这个数字很好地反映了智能体在研究工作上能力的总体形态。它不是一个能挺过下一次修订的精确数字。

值得关注什么

值得关注的进展不是标题中的百分比上升。而是哪些任务开始通过。如果智能体开始完成需要多步恢复的工作流,那才是真正的进步。如果收益只来自更简单的环境搭建和数据清理任务,那么天花板会比标题所暗示的更低。

一个诚实地报告低数字的基准,比一个报告人们无法复现的高数字的基准更有用。这个基准正在做第一件事,而这个领域需要更多这样的东西。

相关文章