中國的新開放模型正被訓練成代理基底

過去一週中國實驗室發布的三款模型,都帶有同一種設計直覺;如果你只把它們當成一串參數量來讀,很容易錯過這一點。它們沒有一款是為了擅長對話而打造。
它們被打造來成為代理運作其上的東西。這是不同的目標;如果你假設目標是做出更好的聊天機器人,那麼隨之而來的訓練選擇看起來會很奇怪。
把任務與任務所處的世界一起訓練
最清楚的例子是 ZhiZhi 創新研究院於 9 月 29 日發布的 IQuest-Q1。它是稀疏混合專家模型,總參數 3,200 億、活躍參數 150 億,並具備 524,288 個 token 的上下文視窗。與其訓練方法相比,架構本身並不特別。
團隊不是用人類對話逐字稿或靜態指令集來微調,而是把任務與任務發生的環境一起合成出來。接著,模型在數種不同的代理鷹架上進行訓練。每個鷹架的原生工具與上下文管理都保持不變,只有模型自身的錯誤被當作學習訊號。外殼本身不准成為學習內容。之後,四個專家模型透過多教師同策略蒸餾合併成一個。
這很重要,因為任何打造代理的人都碰過一個問題:在基準測試拿高分的模型,當你把它包進自己的工具裡時,可能就會崩潰,因為它學到的是別人外殼的怪癖。讓模型跨不同鷹架訓練、同時固定外殼,正是針對這個特定失敗模式下手。根據回報結果,這款模型在自然語言到程式碼庫的任務上,表現僅次於 Claude Opus 5;擅長這件事雖然聽起來很奇怪,卻正是程式編寫代理所需要的。
在同一步中看見與決定
第二款發布採取了不同路線,但目標相同。同一天,上海人工智慧實驗室推出了名為書生明覺的決策模型,共有三種規模:0.8B、2B 與 4B。它小,是刻意設計的。
其設計原則是,感知與決策不該是分開的階段。多數代理堆疊會先截圖、交給視覺模型、取得描述、把描述傳給規劃器,然後才行動。每一次傳遞都會增加延遲並流失細節。明覺把原生視覺感知與指令遵循融合在一起,讓模型看著螢幕就能一次做出判斷。該實驗室回報,它在決策品質上勝過 Jev 與同級開放模型。對必須在動態環境中行動的代理來說,尺寸正是重點:4B 模型可以貼近迴圈運行,而 320B 模型做不到。
刪掉注意力層,以達到百萬 token
第三款發布在架構上最為激進。北京實驗室 NaiveAI 的 Naive N0.5 Flash 是 3,090 億參數的混合專家模型,活躍參數 155 億,建構於小米的 MiMo-V2.5 之上。它原生支援一百萬 token 的上下文,並以 MIT 授權發布。
有趣的部分在於它移除了什麼。這款模型混合使用滑動視窗注意力與 DeepSeek 的稀疏注意力,而且完全沒有全注意力層。標準 transformer 注意力會隨序列長度呈二次方成長,這就是長上下文在歷史上如此昂貴的原因。移除全注意力是在押注:長序列中有用的資訊可以透過結構化稀疏性取得;如果這套做法成立,就會改變代理一次能保持在視野中的內容。一百萬 token 大約是一份大型程式碼庫,或一段長時間工作階段的歷史,而且不需截斷就能保留。
較小的發布也指向同一方向
這個模式不只出現在這三款模型上。清華的 Puro-2B 訓練成本約 4,400 美元,卻在十五項任務上平均勝過更大的 Qwen 模型。某電信實驗室發布了 TeleOCR,這是一款 1.2B 的文件解析模型,在一項文件理解基準測試中居冠。史丹佛與 NVIDIA 發布了一款對比式驗證器,透過嵌入對齊而非推理來挑選最佳候選行動,並回報相較於同級評審模型有大幅加速。
這些每一個都是代理中的元件,而不是使用者直接前往的目的地。一款能便宜地排序候選行動的驗證器、一款解析文件的小模型、一款決定該點擊什麼的微型模型。這些零件正變得專門化且越來越小,而那個負責承載整個工作階段上下文的模型則變得非常巨大。
還沒有人解決的評估問題
這一切之中有個貫穿其中的漏洞。代理基礎模型的基準測試,大多仍沿用聊天機器人評估,而那只衡量了錯誤的東西。一款模型可以在推理測驗拿高分,卻仍是糟糕的代理基底,因為真正重要的性質只有在整個工作階段中才會顯現:經過幾輪之後上下文會開始劣化、失敗的工具呼叫是否會被合理重試、模型是否會注意到自己已經偏離原始目標。
這裡多數回報的數字都來自實驗室自己,而且是在它們協助定義的基準上。IQuest-Q1 在自然語言到程式碼庫任務上「僅次於 Claude Opus 5」,是廠商比較。明覺「勝過 Jev」是廠商宣稱。Naive N0.5 Flash 缺少全注意力,則是容易驗證的架構事實,但其實際後果尚未在大規模情境下被衡量。這些都不代表方向錯了。這意味著誠實的現況是:我們有三個有趣的設計,卻幾乎沒有獨立證據能說明,當代理連續運行六小時時,哪一個能撐住。
這個落差開始被承認。獨立團隊一直在建立針對正式環境服務、而非程式碼生成的基準測試,以及針對代理劫持、而非模型安全的基準測試,這顯示該領域知道自己一直量錯了層級。在這些基準成熟之前,這類發布中有用的訊號不是分數,而是訓練方法;因為一套能處理已知代理失敗模式的方法,比一個只為了排行榜而存在的數字更可能是真的。
這個轉變還有一個容易遭到忽略的後果。如果重要的模型變成小型元件,而不是大型目的地,那麼實驗室的優勢就不再來自擁有最大的模型,而是來自知道這些零件如何拼在一起。一個團隊若能訓練出快速的決策模型、便宜的文件解析器與驗證器,並把它們接進可在普通硬體上運行的迴圈,就能擁有單一巨大檢查點無法比擬的東西。那是不同種類的競爭,更接近系統工程,而不是規模擴張;本月陸續發布的成果顯示,至少已有幾家中國團隊重新調整方向,朝這個目標前進。
兩年來,開放權重競賽的衡量標準,是一款免費模型能多接近前沿聊天機器人。那個框架正在失去影響力。聊天品質已成為基本門檻,而決定軟體能否運作的問題,已經轉移到不同的地面上:在上下文劣化之前能撐過多少輪、模型在迴圈中能多快行動、它被丟進別人的工具鏈時能有多好的耐受度。
能回答這些問題的模型,不會贏得多少排行榜。它們會贏得另一場較不顯眼的競賽:當聊天機器人已經完成它的工作,而真正的工作必須開始時,開發者會伸手選用哪一個。這場競賽本週悄然上演,就在那三款無意用對話來驚豔任何人的發布之中。