← 返回部落格
Ai預計閱讀 9 分鐘

Step 5 跳過四個版本號,在開源模型中名列第二,卻沒人在呼叫它

發布於 2026年10月5日
Step 5 跳過四個版本號,在開源模型中名列第二,卻沒人在呼叫它

2026 年 9 月底,中國實驗室 StepFun 發布了 Step 5 Preview。這個版本號不是筆誤。該系列的前一款模型是 Step 3.7 Flash,而公司直接跳過了整個 4 系列來到這裡。開源版本預定於 10 月 15 日發布,而該模型目前已可透過 StepFun 的產品與 API 使用。

這份規格瞄準單一任務。Step 5 Preview 使用 6,000 億總參數、270 億活躍參數,支援 100 萬 token 上下文,並原生接受文字與圖像。StepFun 將它定位於程式編寫、軟體工程與長時程代理任務,而非一般聊天。

在 Artificial Analysis 智慧指數上,它得到 44 分。這讓它與 Kimi K3 和 Grok 4.6 持平,落後 GLM-5.3 一分,並在全球開源模型中並列第二。三個月前,Step 3.7 Flash 在同一指數上大約是 19 分。

在強光下,一疊高高堆起的扁平粗糙石塊平衡於深色表面上

這個躍進不難解釋

單一版本就攀升 25 分聽起來難以置信,直到你檢視它底下改變了什麼。Step 3.7 Flash 是為視覺工作打造的小型快速模型。它擅長讀取螢幕截圖與影片影格,但根據把它接進程式編寫工具的開發者所說,它不夠強大,無法把複雜工作交給它。Step 5 Preview 是不同等級的模型,活躍參數預算大約是原來的三倍,上下文視窗大小足以容納整個程式碼庫,而且訓練明確瞄準代理式行為。

中國實驗室在 2026 年一直沿用這套劇本。先發布快速的小型模型,了解哪裡會出問題,再把算力花在前沿嘗試上。這裡不尋常的是公開的版本號算術,而這套算術對 StepFun 有利。用過 Step 3.7 Flash 的人不會把它與 Step 5 Preview 搞混,而兩者之間的差距讓進步程度不用看基準測試圖表也能清楚看出。

獨立的早期測試以一個平淡的觀察支持這項說法。一位把該模型接到程式編寫代理的開發者回報,輸出很穩定,而且工程程式碼回來時需要重做的循環更少。這正是對程式編寫模型重要的那種讚美,而且它平淡到足以讓人相信。

採用數字才是真正的故事

這裡就是這次發布變得有趣的地方。OpenRouter 每週公布模型呼叫量排名,而 Step 5 Preview 並未進入前十名。它擁有基準測試排名、上下文視窗與開放授權,卻沒有在最多人使用的多模型路由器上被大量呼叫。

這個落差值得好好思考,因為它描述的是中國開放權重發布的一個模式,而不是這個模型特有的失敗。基準測試排名是生產者用來判斷模型的訊號。呼叫量是消費者透過使用模型所產生的訊號。兩者這一年來一直在分道揚鑣。

部分解釋是結構性的。OpenRouter 的流量主要由兩類開發者主導:一是所在市場對代管中國模型有採購或合規疑慮的開發者,二是工作負載早已整合到團隊一開始選擇的任何模型上。即使模型免費,轉換成本仍然真實存在,因為整合工作並不免費。如果轉換成本超過感知到的效益,一個模型就算更好,仍然可能落敗。

部分原因是通路。StepFun 不是 Google 或 Meta,也沒有能把開發者導入其端點的管道。10 月 15 日的開源發布會比任何基準測試告訴我們更多,因為人們可以下載並在本機執行的權重,完全繞過了代管問題。那一刻,模型不再需要廠商關係才能被採用。

還有一個中國實驗室一直遲遲未能解決的語言門檻問題。每一位嘗試 Step 5 Preview 的西方開發者,都必須摸索一套首先為國內受眾撰寫的 API 主控台、文件與錯誤訊息。一個在指數上只落後領導者一分的模型,可能在第一次請求上就落後十五分鐘,而第一次請求才是真正決定採用與否的地方。

本機執行路徑可能改變什麼

開放權重發布是這個故事中最有上漲空間的部分,值得具體說明原因。

能下載權重的開發者一次移除兩個障礙。不需要建立廠商關係,也不必爭論推論在哪裡發生,或資料跨越了誰的司法管轄區。對歐洲或北美的團隊來說,在評估中國模型與本國模型時,這項差異往往是決定性因素,而不是附註。這也是 Llama 與 Qwen 衍生模型會出現在那些絕不會呼叫其他國家代管端點的企業內部的同樣原因。

問題在於,開放權重把成本從按 token 計費的帳單轉移到硬體與營運。一個有 6,000 億參數、270 億活躍參數的模型,並不是在工作站上跑得動的。要把它服務到在成本上足以勝過代管端點,需要企業級 GPU 或積極的量化版本,而量化版本是由社群而非實驗室提供。決定這個模型何時對大多數團隊實際可用的,是那條時程,而不是授權日期。

StepFun 的發布時程顯示該公司理解這一點,因為權重將於 10 月 15 日釋出,而模型自 9 月底起已可透過自家 API 使用。這段落差讓實驗室有一個月的時間納入正式環境回饋,之後人們真正能檢查的版本才會公開。

這對開放權重市場說明了什麼

Step 5 Preview 進入的是一個擁擠的領域,而這個領域在過去一年已經轉移了競爭軸線。2026 年初,問題是哪個模型登上排行榜榜首。到了秋天,決定採用的問題已經變成更實際的事情:授權允許什麼、哪些晶片廠商已經調整其工具鏈、微調堆疊有多完整,以及圍繞它的社群有多活躍。

這項轉變對今天任何挑選模型的人都很重要。一個在基準測試領先,卻沒有明確部署路徑、沒有量化版本、社群薄弱的模型,在整合時間上的成本會高於一個稍微較弱但工具運作正常的模型。基準測試告訴你模型能做什麼。生態系告訴你弄清楚這件事要付出多少代價。

StepFun 的賭注似乎是:能力躍進能買到關注,而 10 月 15 日的開放權重發布會把部分關注轉化為使用。這是合理的賭注,也是標準做法。2026 年幾乎每一次中國前沿模型發布都遵循同樣的弧線:強勁的基準測試排名、開放權重、國內晶片廠商的一連串調適,然後是一個安靜的問題:每週呼叫量到底有沒有變動。

Step 5 Preview 真正值得注意的地方,在於其規格的紀律。100 萬 token 上下文、代理式訓練,以及 270 億活躍參數預算,是一個針對工程工作的連貫產品,而不是通用型競爭者。StepFun 跳過了四個版本號,但沒有在任務清單上過度膨脹。開發者是否注意到是另一回事,答案會顯示在呼叫量上,而不是在評論中。

相關文章