Seedream 5.0 Pro 只編輯一個元素,畫面其餘部分保持不變

--- title: Seedream 5.0 Pro 只編輯一個元素,畫面其餘部分保持不變 slug: seedream-5-0-pro-edits-one-element-and-leaves-the-frame-alone meta_title: Seedream 5.0 Pro 的克制正是其特色 meta_description: ByteDance 的 Seedream 5.0 Pro Edit 只變更單一元素並保留畫面其餘部分,這正是生產流程真正需要的。 category: ai tags: Seedream 5.0 Pro,ByteDance,image editing,region editing,bounding box,reference images,image generation,Arena,photorealism ---
大多數影像編輯器會重新生成。要求更換服裝,你會得到一個新場景,裡面有一個相似的人,這表示下游每個已核准的細節都得重新核准。ByteDance 的 Seedream 5.0 Pro Edit 則建立在相反的直覺上:只改變你要求的那個東西,其餘一切留在原位。
這種克制在實務上的樣貌
在一項入門測試中,替單一主體重新上色,背景森林、雪的質感、太陽位置、落雪,以及主體的確切姿勢與取景都保留了下來。這種構圖保真度,才讓編輯能在真實的生產流程中使用;畢竟重新生成背景就代表下游工作要重做。
此模型最多接受十張參考影像,因此編輯可以依據額外脈絡來調節,而不只是依賴原始畫面。輸出為 1K 與 2K。在某些供應商上,API 成本約為每張影像 0.042 美元。
它很慢。每次編輯大約要預留兩分鐘,實測約 117 秒。
產品分級結構說明了公司為何把模型拆成兩個。Flash 鎖定對價格敏感的批次作業,在那些情境中場景可以無後果地重建。Pro 則鎖定相反的情況:原始素材已經核准,只有一個元素有疑問。兩者之間怎麼選,是工作流程的決定,而不是品質偏好。
參考影像會改變編輯能做到什麼。更換服裝可以依據產品型錄影像來調節,而不是用文字描述服裝。產品置入可以依據包裝設計來調節,讓算圖出來的物件與實體一致。以影像而非文字作為條件,才讓編輯成果可被審查:審查者可以拿參考影像與結果比對,而不是解讀提示詞。
互動式編輯介面
ByteDance 的文件說明了 Pro 與 Flash 皆適用的點選與框選工作流程。使用者上傳一張參考影像,選取一個點或畫出一個邊界框,前端會把選取範圍轉換成 0 到 999 網格上的正規化座標,其中左上角是 0,0,右下角是 999,999。這些座標會與自然語言指令一起插入提示詞中。

系統支援兩種座標格式。單點,x y,讓模型自行判斷受影響的區域。邊界框,x1 y1 x2 y2,則精確鎖定編輯區域。跨影像編輯可以進行合成,因此你能把某張參考影像中的主體放到另一張影像的某個位置,同時取代第二張影像中的物件。
文件中有一個實作範例如同導演真的會寫下的句子:使用 Image 2 中座標 118 331 933 871 的主體,取代 Image 1 中座標 179 283 796 986 的主體。這段敘述之所以仍可讀,是因為精確度由數字承擔。
正規化步驟讓這個介面具備可攜性。座標會隨影像顯示方式縮放,因此無論畫布大小為何,同樣的選取範圍都能運作。該公司發布的一個示範專案展示了完整流程,從把影像放上畫布、進行選取,到呼叫模型。
Seedream 的 Pro 等級也接受最多十張參考影像,這讓編輯更接近合成步驟,而不是修補。多張參考影像並各自指派角色,這種 FLUX 3 Image 也支援的安排,正成為前沿編輯器之間的共同模式。
可量測的取捨
除了保留原貌之外,ByteDance 與第三方公布的數字在各類別間表現不一。身分一致性得分接近最高區間,而文字渲染與故事性則遠遠落後。照片寫實度與編輯品質則名列前茅。
這樣的表現輪廓說明,這個模型更擅長琢磨既有願景,而不是從零創造複雜願景。對瓶頸在於忠實呈現已核准設計的團隊而言,這樣的表現是有利的。對要生成帶有內嵌文案的海報的團隊而言,文字渲染的落差則是決定這項工具是否適用的限制。
速度是另一項取捨,而且影響很大。每次編輯約兩分鐘,對批次作業來說可以接受,對互動式工作則很尷尬。Flash 就是為了無法等待的情況而存在。Flash 是為價格敏感度而打造,Pro 則是為原始影像已核准、只需更動一個東西的情況而打造。
定價所暗示的使用方式
每張影像約四美分的定價之所以有意義,不是因為絕對金額便宜,而是因為它改變了工作流程能負擔的做法。以這個價格,對單一元素迭代十幾次花不到半美元,遠低於設計師手動遮罩並重繪一個區域的人工成本。
正是這樣的算式,讓點選與框選介面不只是便利功能。當修正幾乎不花錢時,正確做法是進行許多小修正,而不是寫一個大型的推測性提示詞。把這件事內化的團隊,會停止撰寫描述整個場景的提示詞,轉而撰寫描述針對參考影像的單一變更的提示詞。
十張參考影像的上限也有成本形狀。增加參考影像在延遲與提示詞複雜度上都不是免費的,因此運作良好的流程會及早決定哪些參考影像具關鍵作用。一張定義服裝顏色與剪裁的型錄影像值得佔一個名額。一張只稍微調整氛圍的氛圍參考影像則未必。
值得了解的失敗模式
保留原貌是模型的承諾,但它有時會以可預測的方式打破這個承諾。與被移動物件相關的陰影和反射往往會留在原地,看起來像算圖錯誤,而不是藝術選擇。髮絲與線框等細薄結構難以乾淨替換。帶有光線漸層的表面,最後可能出現明顯接縫,因為新元素的光照與舊元素不一致。
未觸及區域內的文字是最常見的意外。背景中的招牌可能在主體替換後倖存,但其中一個字母移位了,而這正是審查者在掃視確認是否保留原貌時會漏掉的變動。
實務上的緩解方式是檢查編輯區域周遭,包括編輯本身。審查者若查看邊界框外百分之五的邊緣範圍,就能在這些瑕疵送到客戶手中前攔下大多數。
這對生成素材為何重要
當生成影像進入專業工作流程,價值就從創造素材轉移到保留素材。一個品牌核准了一張主視覺影像,接著需要把產品換成另一個款式、把模特兒的外套重新上色以配合區域活動、把背景光線調整到與第二張照片相符。這些每一項都是單一元素編輯,而如果編輯會重置其他一切,每一項都會變得昂貴。
對團隊層級的結果是,單一生成的畫面可以成為上百個下游素材的來源,而不會失去已核准的細節。實體攝影就是這樣運作:一次拍攝核准一次,之後的變體來自調整,而不是重拍。
保留原貌也降低了審查成本。核准一張影像涉及檢查一長串細節:品牌標誌、表情、姿勢、背景乾淨程度、色彩準確度。當編輯只改變一件事,審查者只需重新檢查一件事。當編輯重新生成整個畫面,清單上的每一項都必須再次驗證。
把保留原貌視為主要合約的編輯工具,才能讓生成影像經得起生產流程的考驗。克制就是特色,而它比更高的保真度分數更難打造。
剩下的落差是文字。Seedream 5.0 Pro Edit 渲染文字的可靠度,不如它保留構圖的可靠度,因此需要內嵌文案的素材仍需獨立的排版步驟。這正是 FLUX 3 Image 所宣稱的文字渲染能力成為更相關產品的地方,也是這兩款模型變成互補而非競爭對手的地方。