阿里巴巴 Qwen3.8-Max 声称能自主编程两周

10 月 2 日,阿里巴巴 Qwen 团队发布了 Qwen3.8-Max,这是一个拥有 2.4 万亿参数的混合专家模型,官方称其能胜任法律、金融、设计等数百种任务类型。但真正吸引最多关注的宣称,比参数规模要窄得多。根据发布信息,该模型可以在编程任务上自主工作十几天,交付一个完整的项目。
参数规模早就不再是新闻了。真正值得推敲的数字是“十二天”,因为它描述的是另一种能力,与大多数模型随发布附带的演示所展示的能力并不相同。
单个任务 vs 一个完整项目
大多数编程模型基准测试衡量的都是单一工作单元:写一个函数、修一个 bug、回答一个关于代码仓库的问题。其时间跨度以分钟计。能在这些测试中取得成功的模型,证明的是当问题被完整定义、结果可以一步验证时,它能产出正确的输出。
一个耗时十二天的项目,并不是一个更长的函数。它是一连串的决策,每一个决策都会约束下一个,而模型必须在数千次编辑中始终把整体设计记在脑中。失败模式也随之改变。一个单步正确率 95% 的模型,在五分钟的任务里是出色的助手,在两周的任务里却是隐患,因为错误会累积,而且没有人盯着每一次编辑。
这就是为什么“时间跨度”这一宣称比参数规模更重要。它把问题从能力转移到了可靠性。
长时程究竟需要什么
有三件事必须成立,而它们都不是纯粹的模型属性。
首先是记忆与状态管理。十二天的工作量无法装进上下文窗口,无论这个窗口有多大。系统必须把任务状态外置,将中间结果写入磁盘,并在中断后从检查点恢复。这是模型周边的基础设施,其正确性决定了长时间运行能否在重启后存活下来。
其次是自我纠错。在长时程中,模型一定会走错路。没有人类逐步审查,它就需要一种方式,能在某个方向开始失败时察觉,并在失败扩散之前加以修正。这意味着模型必须对照最初的目标来评估自己的中间输出,而这比一开始生成输出更难。
第三是工具稳定性。一个持续多天的项目会涉及代码库、测试运行器、文档,可能还有包管理器。每一次工具调用,都是一次模型预期与环境返回不一致的机会。在数千次调用中,正是这一分布的尾部决定了运行的终结。
综合来看,这个“十二天”的宣称其实是关于整个系统的:模型,加上运行框架(harness),加上环境。这样理解很有用,因为它告诉你出问题时该去哪里找原因。
框架之争才是潜台词
这次发布的时间点并非偶然。智能体研究者之间正有一场争论:一个强大的模型到底还需要多少脚手架。问题是,更好的模型是否会让精心搭建的智能体框架变得过时,还是说可靠性恰恰来自框架本身。
宣称能自主工作十二天,站在这场争论的某一边。它暗示模型能独挑大梁,框架只是配角。但上面那三项要求指向的却是相反的结论:正是框架让这样的时间跨度成为可能,而模型只是其中的一个组件。
两种解读可以同时成立,这大概是最公允的说法。更强的模型降低了一个任务所需的“手把手”程度,同时也抬高了精心打造的框架所能达到的上限。一个能进行长时程规划的模型,放在好框架里价值更高,而不是更低。
宣称中属于办公的那一半
这次发布把编程与办公放在一起,而这种组合并非偶然。这两类任务的输出都是可检验的,而正是这一点让自主性变得可行。带有公式错误的电子表格可以测试。缺少条款的合同可以对照清单审查。模型不需要对世界整体判断正确,只需要对一个有可验证答案的任务判断正确。
这也是为什么这一宣称比初听起来要窄。一个能在代码库上自主运行两周的模型,并不等于一个能在开放式研究问题上自主运行两周的模型——后者的工作是否正确,要很久以后才能有人判断。发布的表述把承诺保持在存在反馈的领域之内。
这样来看,“十二天”这个数字就不只是关于能力,同样也是关于验证。时间跨度越长,系统就越依赖能够检查自己的工作。
选择这两个领域有其商业逻辑。编程和办公正是企业已有预算、且无需专家就能评估产出的地方。一个能自动化两周开发任务的模型,回报是可衡量的。一个会写诗的模型则不是。
如何评估这一宣称
忽略参数规模,去看三个具体细节。
问一问“自主”在实践中意味着什么。一次带有偶尔人工检查点的十二天运行,与一次无人值守持续推进的运行,是不同的产品。企业很少说明检查点在哪里,而这个细节比总时长更能决定其实用性。
问一问这次运行产出了什么。一个完成的项目是可供测试的产物。代码仓库、通过的测试套件、可用的部署,都能被验证。截图和配解说的演示则不能。
问一问它崩掉时发生了什么。长时间运行会失败,而有意思的信息就在于它是怎么失败的。一个能察觉走进死胡同并回退的模型,远比一个硬着头皮往前、产出看似合理却跑不起来的结果的模型有用得多。
这对市场意味着什么
阿里巴巴推出一款面向编程与办公、而非通用对话的旗舰模型,本身就是对价值所在的一种表态。消费级聊天机器人市场拥挤且难以变现。企业愿意付费的,是那些替代或增强人力的工作,而这类工作的时间跨度很长。
如果“十二天”的宣称哪怕只部分成立,实际效果就是小团队可以尝试以前需要更大团队才能做的项目。如果不成立,这个模型仍然是一个拥有大上下文的强力编程助手,而“十二天”这句话自会从营销材料中淡出。无论如何,这一表述框架才是真正有用的部分。如今衡量能力,既要看模型一次能做成什么,也要看它能在无人监督下持续工作多久。