← 返回博客
News预计阅读 10 分钟

OpenAI 的研究循环正在开始自我闭合

发布于 2026年10月2日
OpenAI 的研究循环正在开始自我闭合

The Information 于 9 月 21 日报道称,OpenAI 内部的 AI 模型已在很大程度上实现了新实验模型训练流程的自动化,包括编写 GPU 内核代码和优化训练代码。其中最引人注目的一点,是这项工作如何启动:研究人员只需给系统一个它应当追求的优化示例,AI 随后便自行花上数周时间实现并测试类似的改进。

第二个细节更加离奇。多个内部 AI 智能体已开始在没有人类参与的情况下协作解决问题。据报道,一些过去需要数年工程投入的案例,如今约一周即可完成。

如果这一描述属实,那么真正有意思的地方并不是 AI 会写内核代码——模型做这件事已经有一段时间了。有意思的是这个循环的方向。当 AI 帮助让下一代模型变得更快,而这个更快的模型又帮助打造再下一代的模型时,改进便会在研究流程内部不断累积,而不是停留在面向用户的层面。

为什么这与写代码不是一回事

实现训练循环的自动化,与实现一项编码任务的自动化并不相同,这一区别值得精确说明。为应用编写一个功能,目标已知:功能能用或不能用。而优化一次训练运行,目标则是开放的。系统必须找到既能加快训练、降低成本又不损害模型的改动,而且要在这样一个搜索空间里完成——其中大多数改动只会让结果更糟。

报道所述的工作流程表明,难点已被收窄。人类提供一个好的优化示例,由此界定问题的形态;AI 则把这一形态复制到代码库的其他部分。这是一种真实的能力,同时也是一种有边界的能力,因为决定什么算是有前景的方向的,仍然是人。

正是这条边界,让这个说法变得有意思。把一个已知的优化复制到整个代码库,是当今一个强模型就能完成的工作。而发现一个无人找到过的优化,则是另一回事,报道也没有声称做到了这一点。它所描述的,是从训练流程中消除掉一大类技术性劳动,这与流程自我改进并不等同,尽管两者在边缘处会显得模糊难分。

多智能体协作这一说法更难评估。智能体在没有人类参与的情况下协同工作,听起来像是一次阶跃式变化;但它也可能只是指智能体在人类设计的工作流中互相传递结构化输出。两者都与报道内容相符。它们之间的差距,就是一种新型研究组织与一段长长的自动化脚本之间的差距。

诚实地陈述递归论证

递归式自我改进指的是这样一种设想:一个能够改进自身的智能,会越来越快地改进自身,从而产生一条起初看似平缓、随后陡然上升的曲线。这个概念自 I. J. Good 于 1965 年写下“智能爆炸”以来便已存在,但大多停留于理论,因为循环总是会断掉。一个会写代码的模型很有用;而一个能改进“生产下一个模型之流程”的模型,则是另一回事。

报道中的情形之所以值得关注,是因为这个循环有一把天然的标尺:训练效率很容易量化。如果 AI 辅助的训练工作真能把长达数年的工程投入压缩到一周,那么它会体现在 OpenAI 发布新模型的频率上,以及每个模型所耗费的算力上。真正闭合的研究循环会产生一种可观察的节奏;而没有闭合的研究循环,只会产生一轮新闻周期。

这就是我会采用的检验标准:不是报道是否属实,而是未来十二个月是否会在成本相当的情况下出现更快的模型发布。如果循环正在闭合,发布的节奏就会改变;如果没有,这则消息也不过是又一个半衰期很短的能力宣称。

为什么节奏比宣称本身更重要

除了内容本身,这则报道出现的时机也值得关注。前沿模型的训练撞上了一堵墙,而这堵墙是由成本砌成的。如今单次大规模训练所消耗的电力、芯片和工程时间,已到了这样的量级:10% 的效率提升比一项新的基准纪录更有价值,因为它决定了一家实验室下个季度能负担得起多少次实验。

这就改变了一个优化训练代码的 AI 的价值所在。它并不是通往科幻意义上自我改进机器的一步,而是对实验室最昂贵环节的倍增器——而优势正是来自对最昂贵项目的倍增。两家算力预算相同、但其中一家训练循环快 10% 的实验室,不会在均势上维持太久。

这样看来,这则报道关乎的与其说是意识,不如说是资本效率。真正重要的循环并非模型改进自身,而是模型降低下一次实验的成本,从而让实验室能做更多实验——这正是任何技术加速的寻常路径。

无人能够核实的那部分

这类报道最诚实的问题在于核实。没有论文,没有基准测试,也没有独立复现。说法来自一家公司内部——它有充分动机让人相信,却没有义务展示自己的推导过程。这并不意味着它是假的,只是意味着任何外部人士所能抱有的信心,都被信源本身所限定。

这并非 OpenAI 独有。如今每家前沿实验室都会提出关于内部自动化的说法,而这些都处于公开评估之外;即便数字无法核实,把这些说法披露出来的报道仍然在做有益的工作。这个模式并不陌生:一项能力被描述出来,描述听上去合理,而证据会在之后的某个时间点到来——或者不会。

还有一个问题是,这些自动化究竟是为了什么。Altman 在 9 月初的一档播客中表示,OpenAI 一定会制造人形机器人,而难的是“大脑”而不是“身体”。一个能够自我加速的研究流程,与把这种智能装进物理机器的雄心,是同一命题的两半。训练循环不是产品本身,而是让下一个产品成为可能的东西。

如果这一切成立,意味着什么

假设报道中的节奏是真实的。直接效果是,前沿实验室在单位时间内可以探索更多想法,因为测试一项优化的成本下降了。这有利于那些已经拥有规模化算力和数据的实验室——也就是今天领跑的那一批。这是一种为在位者不断累积的优势,而不是让更小的团队追上来的助力。

间接影响则落在研究工作岗位上。报道所描述的工作——编写内核、调优训练代码——正是自动化最先触及的那类技术性、但定义明确的劳动。做过这些工作的人会向上游移动,去界定什么值得优化——而这正是报道仍然交给人来做的那部分。

这种解读不如“智能爆炸”那样戏剧化,却更有利于规划。报道中的新闻并不是 OpenAI 造出了一台能自我改进的机器,而是训练流程悄然吸收掉了研究中最容易明确规范的那部分,而把需要判断的决策留在了原处。

相关文章