← 返回部落格
Ai預計閱讀 10 分鐘

每棟 1.50 美元的房子:精準編輯化身生產線

發布於 2026年10月3日
每棟 1.50 美元的房子:精準編輯化身生產線

一個正在流傳的示範把兩個模型結合起來,成果看起來與其說是 AI 藝術把戲,不如說更像一座工廠。它將名為 SAM 3.1 的分割模型與 Ideogram 4.5 串接起來;後者是 9 月 30 日推出的編輯模型,並用這對組合重新風格化整批房地產刊登照片。據報導,成本約為每棟房屋 1.50 美元,單次編輯則落在 6 美分左右。

一間極簡現代風客廳,一半暖光照亮、一半空蕩,裡頭只有一張空沙發

無論這個精確數字在真實房仲業者的整個圖庫中是否成立,這個說法的輪廓才是耐人尋味之處。影像編輯已悄悄從「生成新東西」跨到「只改一件事,其餘原封不動」,而這個轉變改變了創意工作流程的成本結構。

為什麼「只改一件事」才是難題

要求模型憑空創造一個場景,它有極大的自由。要求它改變一件夾克的顏色,同時讓身體、姿勢、背景、光線和布料紋理完全保持原樣,問題只會更難,不會更簡單。大多數編輯模型都會漂移。每一次處理都會加入一點小誤差,經過幾次編輯後,影像已悄悄劣化:顏色偏移、紋理糊掉、邊緣變軟。藝術家稱之為偽影累積,這也是為什麼多步驟編輯與其說是習慣,不如說更像一個承諾。

Ideogram 4.5 正是為了對抗這種漂移而打造。該公司的賣點是,它只會碰觸你指定的區域,並保留其他地方的像素。它推出四種品質等級,原生 2K 解析度下每張影像 0.8 到 22 美分,可在 Ideogram 自家平台、其 API,以及包括 Runway、Pika 和 Leonardo AI 在內的首發合作夥伴上使用。開放權重版本已承諾推出,但尚未發布。

對商業工作而言,最重要的能力是 Ideogram 所謂的縮放編輯。你可以裁切進入一張大型高解析度影像,只編輯那個區域,然後把結果接回原始影像,而不必先將整個檔案降尺度。該公司的示範使用約 4,016 x 6,016 像素、略高於 2,400 萬像素的來源影像。對產品攝影師來說,若只是要修正大尺寸照片某個角落的反光,或是室內影像中只需要替換一件家具,這代表的是五分鐘的修改與整張重新生成之間的差別。

這條產線如何組裝

這個房地產示範之所以重要,是因為它展示了這些元件如何結合。分割技術會辨識房間裡有什麼——沙發、牆面、窗戶、地板——並產生遮罩。接著編輯模型會在這些遮罩內作用。過去人類修圖師得花一個下午做遮罩和仿製的流程,如今可以腳本化成一道序列:分割家具、以選定風格替換成佈置後的版本,並讓房間的建築結構與光線保持原樣。

把這套流程套用到空置房產的照片集,就得到虛擬佈置——在影像中為空屋擺設家具,讓買家能想像住在其中的樣子。重點在於經濟效益。實體佈置需要把家具搬進屋內、投保,並支付人力與倉儲費用。虛擬佈置原本就已經更便宜、更快速,而新一代編輯模型把每張影像的成本壓得夠低,讓它成為例行公事,而不是加價的高級服務。

節省下來的成本是真實的,但很容易被誇大。目前虛擬佈置的市場價格,從偶爾使用免費工具時幾乎不用錢,到專業方案每月數百美元都有,有些工具則按房間或按匯出次數收費。當有人報出極低的單次編輯價格時,真正重要的數字是每張可接受影像的成本,而不是每次生成的成本。任何大量執行這項工作的人,都會為額外嘗試編列約 20% 的預算,因為不是每一次輸出都能通過審核。

廠商略而不談的部分

還有一層合規要求,是那些俐落的示範往往會跳過的。宣傳真實房產的影像受到刊登規則約束,在某些地方還有揭露要求。產業指引已趨向於:只有在呈現內容清楚揭露使用了 AI 時,才允許使用 AI 建立的刊登影像。虛擬佈置影像的目的是幫助買家理解空間,而不是錯誤呈現它。

這就限制了自動化能走多遠。替換家具的模型沒問題。但如果模型悄悄把房間變寬、把天花板升高,或捏造一扇不存在的窗戶,就是在製作誤導性的刊登內容,再怎麼節省成本都無法合理化這種做法。針對每一項建築特徵進行人工驗證,仍然是決定影像能否發布的關鍵步驟;而真實刊登的最終交付內容應包含來源檔案、AI 使用紀錄,以及任何必要的揭露聲明。

產品攝影是更安靜的市場

房地產是浮誇的例子,因為成本對比很戲劇化,但同樣的精準編輯流程,適用於任何必須按時程符合品牌規範的產品影像。網路賣家拍攝數千件商品,每一件都需要乾淨的背景、一致的光線、正確的顏色,而且往往還需要一點小修正:移除刮痕、把標籤調正、替換配色。這類工作過去都交給修圖師或進攝影棚重拍,而相對於型錄的節奏,兩者都很慢。

只更改指定區域的模型,比重新繪製整個畫面的生成式模型更適合這種工作流程。如果目標是修正大張影像角落的反光,重繪整張影像有可能悄悄改變產品本身;當買家是靠這張影像判斷自己要訂購什麼時,這是不可接受的。精準編輯會保留必須維持真實的部分,只碰觸需要改變的地方。

同樣的道理也適用於另外兩項過去需要專門工具的工作。一是編輯已經烙印在影像中的文字,例如價格標籤或招牌,同時不干擾周圍的像素。另一項是照片修復,重點在於修補損傷,同時保留原作的真實性。這兩種情況若用大範圍的生成式編輯,都會破壞賦予影像價值的東西,而針對性編輯是唯一可接受的答案。

人類在這套流程中的角色不會消失,而是轉移。修圖師不再手動做遮罩和仿製,而是定義什麼應該改變,然後判斷結果是否忠實。當每次編輯的成本降到幾美分,瓶頸就從製作轉向審查,而能夠分辨好編輯與微妙錯誤編輯的人,會變得更有價值,而不是更沒有價值。

工具與產線之間的分界

這一刻之所以與過去幾年的影像編輯不同,並不是因為模型變得更擅長編輯。而是因為精準編輯已跨過門檻,可以在更長的工作流程中被信任。當模型能可靠地改變一件事、其餘原封不動,它就不再是執行完就可拋諸腦後的新奇事物,而是可以串接的步驟。分割、編輯、驗證、發布。每個階段都可自動化,而且一個階段的輸出會餵給下一個階段。

這就是為什麼 1.50 美元這個數字,無論最終精確落點在哪,都值得注意。在影像只是達成目的之手段的工作流程裡,它是完成一項任務的價格,而不是一張圖片的價格。在這裡勝出的團隊,不會是那些追逐最低生成成本的人。而是那些在模型周圍建立驗證與揭露步驟的人,讓便宜的編輯可以出貨,而不會變成負擔。

相關文章