← 返回部落格
Ai預計閱讀 9 分鐘

Gemini 4 Argon 是你還不能使用的前沿模型

發布於 2026年10月2日
Gemini 4 Argon 是你還不能使用的前沿模型

Google 本週發表 Gemini 4 Argon,並做了比模型發布更罕見的事:產品出貨時就附帶一道門檻。Argon 初期僅透過 Fairwind 計畫開放給一小群精選的網路防禦人員。開發者、企業與一般消費者則要等到之後,待 Google 利用早期測試者的回饋收緊防護措施後才可使用。

這樣的推出順序本身就是重點。Google 大可直接公布一個搶眼基準並開放 API。但它反而把前沿模型當作受控部署來處理,讓這波推出把存取政策變成產品的一部分,而不是附帶的註腳。

數字與價格

Argon 鎖定長時程的軟體工程、法律與金融知識工作,以及網路安全防禦。Google 列出輸出上限為一百萬個 token,並公布 DeepSWE v1.1 達 77.9%、AutomationBench 達 51.3%、LVBench 達 91.7%。Google 表示,該模型能自主尋找、驗證並修補漏洞,且內部已用於大型程式碼庫的遷移。

競爭壓力展現在定價上。Google 列出每百萬輸入 token 2 美元、每百萬輸出 token 10 美元的優惠價,快取輸入另享 95% 折扣。這些數字幾乎直接落在 OpenAI 的 GPT-6.1 Sol 上;當兩家前沿實驗室把價格訂得如此接近,市場會解讀為對其他所有人的擠壓開始了。

Anthropic 這邊則在爭奪企業支出之際,結束客戶折扣。Claude Sonnet 5.5 目前以 68 分位居 Coding Agent Index 榜首,但其任務也是實測中最昂貴的,單一工作最高達 14.19 美元。GPT-6.1 Sol 在同一指數拿下 63 分,每項任務約 1.04 美元。Sam Altman 稱 Sol 是歷來推出後成長最快的模型,同時也承認它在負載下跑得慢。Google 的 Logan Kilpatrick 則表示,每一次 Gemini 修訂版發布前,都會由數千名軟體工程師進行數週測試。

把這四項事實並排來看,當下的局勢就很清楚。原始能力正在趨同。現在真正在角力的是每項任務的成本、負載下的可靠性,以及一家實驗室願意多早讓大眾接觸它最強的模型。

為什麼限制模型存取是一項產品決策

在聊天機器人時代的大部分時間裡,發布就代表一組 API 金鑰和一個速率限制。Argon 打破了這個模式,原因是它列出的用例本身就屬於危險類型。一個能自主定位並修補漏洞的模型,也是能替別人定位漏洞的模型。一個能在百萬 token 長度上處理法律與金融推理的模型,其錯誤會悄悄複合累積。

設限也創造了 Google 能控制的回饋循環。受信任的測試者會產生實際運作證據,在模型接觸一般大眾之前,回饋給防護措施的改良。這究竟是真正的謹慎,還是為了對抗 OpenAI 爭取時間的一種手段,只有內部資訊才能說明。無論如何,先例已經立下:前沿模型可以用限定計畫的形式推出,而存取決策變得和權重一樣重要。

Agent 開發者能從中學到什麼

Argon 的百萬 token 軌跡長度,對任何在其上打造 agent 的人都很重要。更長的時程讓真正漫長的任務得以實現,也讓可觀測性成為不可妥協的要求。一段橫跨百萬 token 的執行過程,不是人靠讀結尾就能稽核的。

實際的應對方式,是把權限當成設計問題來處理。個人 agent 執行環境應區分讀取、寫入、執行與對外傳送權限,保留原始事件及其來源,並在任何不可逆動作前要求核准。這項建議並非 Argon 專屬,但 Argon 讓它變得迫切,因為一個能連續行動數小時的模型,需要一個能在幾秒內制止它的決策層。

同樣的邏輯也貫穿一股更廣泛的產業趨勢。AWS 發布 Strands Decider 2B,一個開放決策模型,回傳的是選擇與信心度量,而非長篇文字,而且小到可在本機執行。它是為路由、重試、風險分類與工具選擇等有界步驟而打造。這傳達的訊息是:並非每個 agent 步驟都需要前沿模型,把便宜模型放進控制平面,就能更頻繁地檢查。

設限背後的定價碰撞

設限並不是這次發布唯一的訊號。Google 的優惠定價為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,外加 95% 快取折扣,讓 Argon 幾乎正好壓在 OpenAI 的 GPT-6.1 Sol 上。當兩家前沿實驗室如此接近地落在同一價格帶,通常意味著前沿已不再是收取溢價的地方,而是開始比拚成本的地方。

這是市場形態的轉變。在過去兩年的大部分時間裡,昂貴模型之所以昂貴,是因為沒有更便宜的模型能與之接近。一旦能力趨同,買家問的問題就會從哪個模型最好,轉變為哪個模型能以每項完成任務的最低成本做到夠好。一個好 5% 但價格貴三倍的模型很難賣,尤其當差異很少出現在輸出中時。

Argon 的基準數字很強,而有趣的是它們強在哪裡。DeepSWE v1.1 的 77.9% 與 AutomationBench 的 51.3% 描述的是軟體工程與自動化工作,而非一般對話;LVBench 的 91.7% 則指向長影片理解。Google 推銷的不是更好的聊天機器人,而是一個能處理程式碼並觀看長輸入的 agent,而這正是每項任務成本主導總帳單的工作負載。

信任層正在制度化

Google 的設限發布並非憑空發生。一份由主要 AI 公司簽署的新《前沿責任共同承諾》,涵蓋內部監控、獨立外部評估,以及獨立的董事會委員會,範圍包括網路、生物與化學濫用,以及對技術系統的非預期存取。前沿安全正成為組織與稽核問題,而不只是研究團隊的問題。

考驗在於外部評估者能否看到足夠資訊以重現某項發現,以及當控制失效時,這些承諾是否帶來後果。這些問題同樣適用於像 Argon 這樣設限的模型,也適用於開放模型。你控制的閘門,其好壞取決於被允許通過的人。

Argon 指向一個前沿模型負責規劃、而獨立政策與決策層掌握執行的市場。這種分離早已是謹慎團隊的建構方式。Google 只是把它變成自家最強模型的預設做法,其他競爭者也會跟進,因為替代方案是在還沒人談好出錯時由誰負責之前,就推出一個能大規模行動的系統。

相關文章