← 返回部落格
Ai預計閱讀 9 分鐘

Synthesia 花了十年錄製虛擬化身,現在要它們開口回話

發布於 2026年10月5日
Synthesia 花了十年錄製虛擬化身,現在要它們開口回話

Synthesia 的生意建立在一個簡單的循環上。你寫一份腳本、挑一個虛擬化身,然後拿回一支簡報影片。該公司表示,這個循環近十年來一直運行在全世界最大的企業影片平台上,並讓 Synthesia 在 2025 年達到據稱 40 億美元的估值,年度經常性收入突破 1 億美元。

2026 年 10 月 1 日,這個循環轉了個方向。Synthesia 推出 Sessions,一個能與擬真虛擬化身進行雙向對話的平台。兩種 session 類型同日上線,第三種則預告即將推出。

Roleplay Sessions 讓使用者置身於一場本該艱難的對話。虛擬化身扮演客戶、求職者或直屬下屬,而且會反駁你。業務團隊藉此練習需求探詢與異議處理。主管演練那場他們一直迴避與員工進行的對話。客服團隊模擬客訴升溫的情境。每次演練之後,系統會給予指導並為參與者評分。新增的功能讓人們在練習前可依自身處境調整情境,也讓企業能針對自家反覆出現的對話打造客製化角色扮演。

兩張空著的世紀中期現代風格座椅,隔著一張小圓桌相對

Survey Sessions 把表單變成一場訪談。虛擬化身以一對一方式提出公司的問題,針對聽到的回答追問,並回傳結構化的洞察。Synthesia 列出的預期用途包括員工回饋、客戶洞察、離職與流失訪談、NPS 後續追蹤以及產品研究。回應會以跨受訪者的主題與情緒分析形式呈現,任何個別回答都可開啟為逐字稿、音訊檔或 CSV。

Expert Sessions 則仍在規劃階段:一個以公司產品文件與內部流程訓練而成的虛擬化身,能逐步引導某人完成任務,並在其操作過程中回答問題。

這種產品形態的理由

Synthesia 的技術長 Peter Hill 撰寫了這篇發布文章。他的切入點是人力瓶頸,而不是技術故事。對的人永遠不夠用,無論這個人是在艱難通話前逐一指導每位業務的主管、訪談每一位客戶的研究員,還是引導每一位卡關使用者的產品專家。常見的替代方案則是:用錄影取代演練、用表單取代訪談、用說明文件取代手把手指導。

Hill 的經歷讓這套論述比一般發布文章更容易被認真看待。他在 Amazon 與 AWS 待了近 25 年,帶領 Kindle、Fire、Alexa 背後的團隊,以及 Amazon Connect、WorkSpaces 等服務,之後短暫出任 Wildlife Studios 的執行長與產品長。他過去就有大規模交付對話式系統的經驗。

Synthesia 願意公開的早期數據不多,但頗具指向性。在早期部署中,78% 的學習者曾重複嘗試同一個角色扮演,而在回頭再練的人當中,83% 在之後的嘗試中分數有所提升。這段話要仔細讀。真正重要的數字並不是進步率——那是在選擇回來的子集上測得的——而是那 78% 的回流率。一個人們會自願重複使用的訓練工具,和一個因為被指派才做完的工具,是完全不同的產品。

Synthesia 也表示,主題式洞察的目的在於顯示哪些技能帶動績效,而不只是誰得分最高;同時每位員工都會收到建議的角色扮演,以補足自己的落差。這是從回報轉向診斷,而這正是學習與發展團隊真正會去評估的部分。

兩條路線,以及這個分流為何重要

Synthesia 用兩種方式販售同一項能力。Interactive Avatar API 是給想自行打造虛擬化身產品、掌控整個技術堆疊的企業;Sessions 則是現成平台,用於構成日常工作的一般對話。該公司將 API 描述為一套託管管線(hosted pipeline),意味著團隊可以自備語言模型、語音轉文字與文字轉語音,而不必自己運行渲染堆疊。

這個分流比表面上看起來更有意思。已經有偏好模型供應商的企業不想被指定該用哪一家;而既沒有意願、也沒有人力做整合工作的企業,則什麼都不想自己建。兩者都提供,讓 Synthesia 不必只挑一種客戶輪廓。Session 層級的整合在當天就開放了全端 API,這顯示該公司認為 API 才是更安靜、但長期更大的生意。

合規細節值得注意,因為這項產品觸及員工對話與客戶訪談,也就牽涉錄音、逐字稿與個人資料。Synthesia 列出 SOC 2 Type II、ISO 27001、27701 與 42001,以及 GDPR 合規。

這次發布尚未解答的問題

三個問題潛伏在這次發布的表面之下。

第一個是互動品質在展示情境之外能否維持。角色扮演唯有在虛擬化身的反駁既真實又多樣時,才能產生技能移轉。一個太容易就被說服的虛擬化身什麼都教不了;而一個只會照本宣科爭辯的虛擬化身,兩次就會被看破。Synthesia 尚未公布獨立評估,說明其角色扮演對手在各種情境下的行為表現;而它公布的部署數據描述的是重複使用,而不是學習成效。

第二個是紀錄保存的問題。附在員工練習嘗試上的分數,是關於一個人的資料點,由 AI 產生、存放在企業系統中,而且可能對主管可見。78% 的學習者回流,在新聞稿上看起來很健康。但這也意味著大多數參與者都留下了一份紀錄——記錄著他們處理得不好的那場對話。這份紀錄存在哪裡、誰能看到、保留多久,都是每個買方必須做出的政策決定,而答案在例如業務賦能團隊與人資部門之間,會有明顯差異。

第三個是:那些「稀缺」正是整個前提的人類專家,後來怎麼了?如果 Synthesia 說得對——訓練過的虛擬化身能以真人通話成本的一小部分吸收那些重複性的對話——那麼需要真人的指導時刻,就成了昂貴的那一種。對該公司的客戶而言,這是合理的取捨。但無可避免地,這也是一個關於「一份工作中哪些部分會先被自動化」的故事。

這把企業 AI 帶到什麼位置

Sessions 是個有用的指標,因為它把虛擬化身產品從內容生成推進到工作流程。單向的虛擬化身影片,競爭對手是攝影機、攝影棚和截止期限。雙向的虛擬化身,競爭對手是主管的行事曆,而比較的基準已不再是製作成本。重點在於:一個組織能不能每天跑一千場練習對話,並且把結果留下來。

Synthesia 押注的是:大多數組織做不到,而一個會回話的虛擬化身,是比招聘更便宜的答案。互動品質的水準是否足以支撐這樣的替代,將由接下來一年的部署來說明。重複使用率是個有前景的開場訊號。它還不是「練習讓人們在工作上變得更好」的證據。

相關文章