Kimi K3 進入 OpenAI 企業付費體系:中國開源大模型的出海路線正在改寫

10 月 1 日,美國 AI 基礎設施公司 Baseten 對外確認了一件事:企業開發者可以在 OpenAI 的程式設計工具 Codex 裡直接呼叫月之暗面的 Kimi K3,產生的費用直接計入企業既有的 OpenAI 採購額度。不需要新增供應商主體,也不需要重走一遍採購審批。這是中國開源大模型第一次進入 OpenAI 的企業付費結算體系。
這件事的分量,不在參數,也不在榜單,而在於它改變了企業採購的路徑依賴。
採購流程本身就是門檻
大企業接入一家新的模型供應商,麻煩的從來不是技術對接,而是合規與財務流程。新供應商要走准入審核,要單獨搭建帳單和結算體系,要重新過一遍法務和採購。對一個只想驗證某個模型好不好用的團隊來說,這套流程的成本往往比模型本身貴得多。
Kimi K3 走 OpenAI 的額度結算,等於繞開了這一整套摩擦。企業裡已經批下來的 AI 預算可以直接花在 Kimi K3 上,財務上看到的仍然是一張 OpenAI 的帳單。Baseten 作為底層承接入口,把月之暗面的模型能力接進了 OpenAI 的生態通道。
在這之前,Kimi K3 已經登陸亞馬遜雲 Amazon Bedrock 平台,月之暗面也因此成為中國首個與全球頭部雲端廠商按收入分潤模式合作的 AI 企業。一個是雲端平台的收入分潤,一個是開發者工具的額度折抵,兩條路指向同一個結果:中國大模型開始從技術演示階段,走進規模化的商業落地階段。
模型本身是什麼水準
Kimi K3 於今年 7 月發布,參數規模 2.8 兆,在發布時是全球體量最大的開源大模型。它支援 100 萬 Token 的上下文視窗,原生具備視覺理解能力,針對程式開發、深度研究和複雜知識處理做過專項最佳化。
發布當天,Kimi K3 登上國際程式碼評測榜單 Arena 的第一名,是首個拿到該榜首的中國大模型。特斯拉 CEO 馬斯克也公開評價這個成果令人印象深刻。
更值得注意的是它的架構思路。Kimi K3 使用了 Kimi Delta Attention 與 Attention Residuals 來改善長序列裡的資訊流動,並採用 Stable LatentMoE 結構,在 896 個專家裡只啟用 16 個,官方稱相比上一代把擴展效率提升了約 2.5 倍。這個設計方向和最近幾個月中國實驗室的集體動作一致:不拼誰的參數更大,而是拼每一份算力能換來多少可用能力。
一次 48 小時的自主晶片設計
如果說進入 Codex 是商業層面的事,那另一項進展更接近技術本身。
據公開資訊,Kimi K3 已經完成了一次 AI 自主設計晶片的概念驗證。在連續 48 小時不間斷的智慧代理測試中,它依託開源 EDA 工具與 45nm 製程庫,獨立完成了適配晶片的設計、迭代與全流程驗證。產出的是一顆 4 平方毫米的輕量化晶片,搭載 146 萬標準單元和 0.277MB SRAM,在 100MHz 頻率下實現穩定時序收斂,最高解碼吞吐量可達每秒 8700 Token 以上。

這類結果需要謹慎看待。概念驗證不等於可量產的晶片,45nm 也不是什麼先進製程。但它驗證的是流程閉環:一個模型能不能在沒有人逐步介入的情況下,把一件需要多輪試錯的工程任務從頭做到尾。對做智慧代理的人來說,這比單張圖好不好看更能說明問題。
競爭層在往哪走
Kimi K3 的出海動作,和另一條線是並行的。
同一週,智譜發布了開源模型 GLM-4.6,重點升級代理式編碼能力,並完成了對寒武紀、摩爾線程等中國晶片的適配,實現 FP8+Int4 混合量化推論在中國硬體上的穩定部署。DeepSeek 也在 10 月 2 日開源了桌面端智慧代理執行框架 Harness v0.2,採用「萬物皆外掛」的架構,內建檔案整理、資料分析、文件起草、程式碼修改等能力,以 MIT 協議開放。
把這些放在一起看,一個方向變得清楚:模型本身正在變成基礎設施,而真正的差異化開始往兩個地方遷移。一個是執行框架,也就是模型之外的那一層,誰能讓開發者和企業低成本地把模型接進自己的工作流;另一個是硬體適配,誰能把推論跑在更便宜、更自主可控的算力上。
Kimi K3 已經預告了 K3.1,支援 100 萬 Token 上下文,並提供 Low、High、Max 三檔推論強度,由使用者按任務複雜度選擇。長文本和可選推論檔位,正在成為中國開源模型爭奪開發者的標準配備。
中國大模型出海,過去大多是一對一對接海外客戶,大企業要接入就得新增供應商資格審核,落地門檻很高。Kimi K3 這兩步,把門檻往下壓了一截。至於企業願不願意為它買單,接下來的幾個季度會給出答案。