← 返回部落格
Ai預計閱讀 7 分鐘

淘寶 TaoMate-H3 開源:把分鐘級影音連續生成,壓到每段只跑三步去噪

發布於 2026年10月7日
淘寶 TaoMate-H3 開源:把分鐘級影音連續生成,壓到每段只跑三步去噪

阿里 TaoLive AIGC 團隊把 TaoMate-H3 的推理程式碼和 LoRA 權重放上了 GitHub 和 Hugging Face。這個模型做的事不算新:讓畫面和聲音在同一段生成裡出來。但它衡量自己的方式換了,不比誰的單段畫質更猛,而是比從下提示詞到看見第一段成品要等多久。

首段等待時間,一個先前沒人在意的指標

主流影片模型的生成邏輯是整段去噪。你寫一段三十秒的描述,模型會把三十秒的所有幀一起丟進擴散過程反覆迭代,中間不給你任何東西,直到整段算完才一次性交付。這個方法的問題很直白:等待時間和影片長度成正比。想要更長,就得等更久。

TaoMate-H3 走的是逐段推進。它把生成切成小片段,每個片段只需三步去噪,模型先把當前片段交代清楚,再接著生成後面的內容。技術上它把三步 LoRA 推理和自迴歸生成接到了一起,上一段的人物、聲音、場景會作為上下文被帶到下一段。

這個改動帶來的實際差別,在於「什麼時候能看到東西」。做直播講解、虛擬角色表演或者任何需要即時回饋的場景,使用者不等整段影片生成完才第一次看到畫面。首段內容產出時間縮短了,這個指標先前很少有模型把它當成主要賣點來打。機器之心在報導裡提到,TaoMate-H3 主推的正是「首段生成時間」。

聲音怎麼參與生成

影音聯合生成這件事,業界裡有兩種做法。一種是先生成畫面,再讓另一個模型配上聲音,兩段在後期對齊;另一種是讓聲音在生成過程中就參與進來,為嘴型、表情和動作提供時間上的約束。

Two small blank brass sound-wave tiles standing upright on a pale wood table, warm light raking across their smooth unmarked surfaces

TaoMate-H3 是後一種。同一個生成過程裡同時處理聲音和畫面,人物講話、歌唱、角色對白都在這個框架裡,海浪、車輛運動、爆炸這類環境和動作音效也在。對白和畫面的時間配合不用等到後期再修。

輸出規格上,它支援 480p、768p、1080p 三個檔位,橫屏豎屏都能出。場景描述可以寫成一條完整提示詞,也可以按段安排台詞、動作和情節,模型在保留歷史上下文的基礎上往下續。分鐘級的連續生成是它的目標區間。

參數不大,但把它放進真實工作流程才看得懂

TaoMate-H3 基於 MiniMax H3 做後訓練。Base 是別人已經開源的基礎模型,TaoMate 團隊在它上面加了串流生成的能力。這也是權重能這麼快放出來的原因:不需要從頭訓一個大模型,重點在推理管線和 LoRA。

對開發者來說,實際價值有幾個層次。最直接的是可以在自己的硬體上跑,不用依賴雲端 API 做串流生成研究。其次是串流生成本身打開了一些以前不方便做的場景:邊生成邊播放、長時段的角色連續表演、需要根據觀眾反應調整後續內容的互動式影片。

有個限制值得說清楚。三步去噪意味著每段的計算量被壓得很低,代價是單段畫質的天花板。官方示範裡的效果是一回事,放到對畫質要求高的成品交付裡是另一回事。這個模型更像是給「連續生成」這個需求提供了一個可用的開源底座,不是來跟頂尖閉源模型比單幀品質的。

國產開源影片這一年來的路徑

把 TaoMate-H3 放回今年的時間線裡看,會發現一條比較清晰的路徑。年初大家在比參數、比排行榜分數;到了下半年,重點轉成了把模型壓進真實工作流程:更低的顯示記憶體、更快的首幀、更便宜的單秒成本。

MiniMax H3 開源了基礎模型,TaoLive 在它上面做影音串流,阿里 PAI 又放出支援八種控制條件和影片修補的 ControlNet-Union 分支。一個模型出來,很快就有人接著做上層能力。這種分工在開源社群裡跑得比閉源生態快,因為大家不用等誰開放介面。

對做內容的人來說,這些變化最後會落到很具體的地方:做一條需要連續表演的影片,以前可能得把十個片段分開生成再拼接,現在可以按段落寫,模型自己帶著上下文往下走。做完之後哪裡不對,還能只改那一段。

寫在最後

TaoMate-H3 這個發布裡最值得記的,是它把「首段等待」擺到了檯面上。影片生成過去幾年一直在解決「能不能生成」和「生成得好不好」,現在開始有人認真算「什麼時候能看到第一幀」。這個問題的答案,決定了影片模型能不能從示範台走進每日更新的工作流程。

權重和推理程式碼已經開放,接下來看的是社群會不會在它上面長出更多東西,尤其是那些需要長時間連續輸出、又等不起整段渲染的場景。

相關文章