← 返回部落格
Ai8 分鐘

AI 終於學會拼字:文字渲染突破為何重要

發布於 2026年9月26日
AI 終於學會拼字:文字渲染突破為何重要

在 AI 圖像時代的大部分時間裡,都有一個可靠的方法能辨識生成圖像:看畫面中的任何文字。路牌會寫著「PHARNACY」;商店門面會出現「CLSOED」;雜誌封面則布滿了遠看像英文、近看卻變成亂碼的字母。

那個時代正在結束。2026 年間,主要圖像模型修正了文字渲染,社群的反應比任何基準測試結果都更熱烈。

改變了什麼

圖像中的文字之所以困難,有一個具體原因。擴散模型並不「知道」字母是什麼意思。它學習的是視覺模式,而一個單字只是一組筆畫模式。很長一段時間裡,模型可以近似出單字的外形,卻不理解字元的順序,所以你會看到看起來很逼真、實際上卻是亂碼的內容。

新模型採取了不同做法。GPT Image 2、Google 的 Nano Banana Pro,以及較新的開放模型,都將文字視為需要被推理的對象,而不只是被近似模擬的紋理。結果是,模型現在可以渲染標題、標籤、招牌,甚至完整的 UI 截圖,字母順序正確、拼字也正確。

這項改進來得很快。當 @PlayingGodAGI 在 2026 年發布兩張測試圖片時,社群反應非常強烈。一張是解剖圖,每一處肌肉、骨骼和神經的標註都精確到教科書等級。另一張是 YouTube 首頁截圖,介面元素、影片縮圖和標題文字都渲染得沒有變形。他的總結是:「這消除了 AI 生成圖像的最後一個缺陷。」

一個有招牌的店面場景,是 AI 文字渲染的經典測試案例

它開啟了什麼

實際影響比「圖片現在看起來更好了」更大。

第一是招牌與品牌設計。會正確拼字的模型,可以產出帶有品牌名稱的店面示意圖、產品標籤或行銷圖片。過去這需要設計師手動修正文字。現在這已成為生成的一部分。

第二是介面設計。渲染出可信的 UI,包含正確的標籤和版面配置,對原型設計來說是真正實用的能力。YouTube 截圖測試之所以重要,是因為它顯示模型可以重建一個真實、文字密集的介面而不失真。

第三是多語言應用。當日本部落客 @masahirochaen 用日文測試 GPT Image 2,發現假名與漢字都正確渲染時,這改變了「文字渲染」的意義。這不只是英文拼字。它是多語言排版,打開了過去模型基本上無法使用的市場。

Reddit 特別注意到多語言這點。一位留言者指出「漢字和片假名都是正確的」,這句話在兩年前會非常荒謬。

模型是如何做到的

了解文字為何困難是值得的,因為它解釋了為什麼修正幾乎在同一時間發生。

擴散模型從雜訊中生成像素,並由文字提示引導。很長一段時間裡,它並沒有真正將「字母」表示為獨立單位。它學到某些筆畫模式看起來像單字,於是重現了外形,卻沒有追蹤字元順序。這就是為什麼舊的 AI 文字遠看正確、近看錯誤。

這個轉變來自兩個方向。模型更善於將文字視為一等概念,而不是一種紋理;同時,它們在更多真實世界脈絡中的文字範例上接受訓練。招牌、標籤、截圖、書籍封面。一旦訓練資料包含了足夠多的真實文字,模型就不再猜測,而是開始拼字。

結果不是單一突破,而是跨越了一道門檻。文字從「未解決」變成「大致解決」大約花了一年,而社群精準地注意到了發生的時間點。

偵測問題變得更困難

有一個沒有得到足夠關注的負面影響。文字突破讓 AI 圖像更難被辨識,這會帶來實際後果。

多年來,抓出假圖最簡單的方法就是閱讀圖中的文字。偽造的文件、擺拍的截圖、捏造的產品標籤:字母會露出馬腳。對前沿模型來說,這條捷徑如今已不存在,這表示偵測必須轉向更細微的訊號:光線不一致、物理上的不可能,或是平台嵌入的中繼資料與浮水印。

模型本身仍然會在物理邏輯上出錯。魔術方塊的反射、TNT 大砲的彈道軌跡、放大後無法看清楚的地圖。這些是新的破綻,而對一般觀察者來說,它們比拼錯的單字更難發現。

這也正是浮水印和來源證明比以往更重要的原因。如果你無法透過閱讀來辨識生成圖像,就需要平台告訴你這張圖是生成的。Google 的 SynthID 和類似系統是最後防線,而文字突破讓它們變得更重要,而不是更不重要。

尚未解決的部分

幾個誠實的提醒。

短文字已接近解決,但密集文字仍然是最前線。在 2026 年 9 月的一項測試中,八個領先模型都正確拼出了兩個字的產品標籤和促銷標題。現在的差異在於版面配置和長字串。選單或含有一段文字的資訊圖表仍然會出現錯誤,因此「每個公開素材都要校對」的建議仍然適用。

值得注意的是,Midjourney 在長字串文字上仍然偏弱。單一風格化單字沒問題。但包含多個單字的標題就會開始出錯。如果你的作品以排版為主,Midjourney 不是合適的工具。

還有一個大家開始討論的次級問題:文字太好了。當模型能渲染逼真的 UI 或令人信服的新聞圖表,也就更容易製造出看似權威的內容。文字突破是一把雙面刃,它正好落在關於偵測、浮水印與來源證明的持續爭論中。

底線

「AI 不會畫手、AI 不會寫字」的速寫已經過時。手的問題先被解決。文字是更困難的問題,而如今在日常情境中——那些曾經令人尷尬的案例——大部分已經解決。

這不代表每張生成圖像都值得信賴。這表示破綻轉移到了更細微的地方,而那些依賴「看拼字」作為偵測技巧的人,需要新的方法。對其他人來說,這只代表圖像變得更好了,而且大量的手動修圖工作悄悄消失了。

相關文章