返回部落格
Ai7 分鐘

認識 VoiceStudio:免費、本機優先的語音複製,支援 646 種語言

發布於 2026年9月2日

告別每月語音 AI 帳單

老實說:最受歡迎的語音生成工具雖然強大,但它們對待你就像跳錶計費的計程車。你輸入的每個字元都要花錢。你上傳的每個音訊檔案都會送到遠端伺服器處理。如果你想要高品質的語音複製,就逃不掉訂閱制,或是在最糟的時刻撞上使用量上限。

VoiceStudio 是一款開源桌面應用程式,專為打破這種循環而打造。它完全免費,執行在你自己的硬體上,把你的電腦變成一座完整的語音製作工作室。沒有訂閱,沒有使用量計算。只有乾淨的本機音訊——基本上就跟聽起來一樣解放。

VoiceStudio 究竟能做什麼?

最核心的功能是語音複製:錄下任何說話者 3 秒鐘的聲音,把檔案拖入,軟體就會以零樣本學習重新建立那個聲音。你甚至可以用同一個複製的聲音生成 646 種語言的語音。

但那只是這間工作室的其中一個房間。VoiceStudio 還包含:


還有話者分離(speaker diarization)功能、可批次處理數十支影片的佇列、看不見的 AI 浮水印,以及一套診斷工具,讓你不用聯絡支援就能排除問題。

實際比較:VoiceStudio 與 ElevenLabs

VoiceStudio 背後的開發者坦承,在英文 TTS 的開箱即用精緻度方面,ElevenLabs 仍然領先。真正的差異在於結構性。

ElevenLabs 只提供少數語言和單一黑箱模型。VoiceStudio 則支援 646 種語言、16 個 TTS 引擎和 11 個 ASR 引擎。你可以從簡單的設定選單切換到 OmniVoice、CosyVoice、GPT-SoVITS、VoxCPM2 等許多引擎。一切都在本機執行,因此你的音訊永遠不會離開電腦,也不會有逐字計費的問題。

代價也可預期:因為模型是在本機執行,輸出品質取決於你的顯示卡和參考音訊。乾淨、近距離錄製的音訊能帶來令人驚豔的複製效果;吵雜或迴音嚴重的參考檔就沒那麼出色。但一旦你用在自己的內容上,很快就會知道它是否適合你——許多使用者在用 VoiceStudio 一個星期後,就刪除了 ElevenLabs 訂閱。

開始使用有多簡單?

選擇你的作業系統(Windows、macOS ARM 或 Linux)並下載最新安裝程式。在第一次啟動時,VoiceStudio 會建立本機 Python 環境並下載模型權重。只需要幾分鐘,之後就完成了。

接著,用三個步驟複製聲音:

  1. 開啟「語音複製」工作區。
  2. 放入任何說話者的 3 秒音訊範例。
  3. 輸入一個句子,然後按「Generate」。

就是這樣。產生的音訊會在裝置上生成並儲存,開箱即支援 646 種語言。

想知道它能跑多快嗎?文件中有基準測試和效能頁面,確切說明生成時間用在哪裡——包括三個經典的變慢原因。這正是大多數商業工具從不分享的透明度。

只能用本機模型嗎?不——你可以選擇引擎

VoiceStudio 搭載一套穩健的預設組合:TTS 用 OmniVoice,語音轉文字用 WhisperX。但這個應用程式內含 16 個 TTS 引擎和 11 個 ASR 引擎,全部都可以在「設定」中切換。想要 Apple Silicon 加速?MLX-Audio 原生支援 macOS。需要快速的英文模型?Parakeet TDT 即使在 CPU 上也能以約十倍的即時速度運作。甚至還有 OpenAI 相容的 ASR 引擎,可連到遠端的 Qwen3-ASR 或任何相容伺服器。

每個引擎的授權與硬體支援各不相同。README 內有完整矩陣表,讓你知道 GPT-SoVITS 和 NVIDIA CUDA 搭配良好,而 MLX-Audio 僅限 Apple Silicon 使用。這種彈性讓 VoiceStudio 比商業語音網站更具多用途性。

透過 API 整合進你的工作流程

你已經有能和 OpenAI 音訊 API 溝通的腳本或代理程式了嗎?把它指向 http://localhost:3900/v1,你甚至不需要 API 金鑰。VoiceStudio 實作了相容的 /v1/audio/speech 和 /v1/audio/transcriptions 端點,並將它們對應到你在應用程式中啟用的任何 TTS 與 ASR 引擎。它甚至透過自訂的 /v1/audio/voices 端點列出你複製好的聲音。

如果你偏好更深入的 REST API,全部 100 多個端點都可在「設定」中的內建 OpenAPI 參考資料取得。另外也支援代理工具:你可以把 VoiceStudio 的技能安裝到 Claude Code、Cursor 或任何 MCP 用戶端,讓 AI 代理程式能免費、離線地在你本機合成語音。加上聽寫工作流程,你就有了得力助手。

VoiceStudio 為誰而做?

VoiceStudio 非常適合剪輯本機影片的 YouTuber、希望更充分掌控 AI 朗讀的有聲書作者、創作對話的遊戲開發者,或任何想在本機嘗試語音 AI 的好奇人士。如果你注重隱私,這是個好消息:應用程式在傳送任何統計資料前都會明確詢問;如果你拒絕,就什麼都不會傳送。你的文字、音訊、聲音和專案永遠不會離開裝置。

在硬體上,你至少需要 8 GB 記憶體和 10 GB 磁碟空間。搭配 4 GB VRAM 的獨立顯示卡就足以入門;而就算只有 CPU 的機器也能跑完整個流程——只是會慢一些。

結論

VoiceStudio 仍處於活躍的 beta 階段,因此請預期偶爾會出現錯誤,也需要一點學習曲線。但以這個採用 AGPL-3.0 免費開源授權的專案而言,功能豐富到近乎誇張:646 種語言、本機語音複製、有聲書製作、影片配音、聽寫、批次處理與開放 API——全部收在直覺化的桌面 UI 中。

如果你一直覺得被封閉的雲端語音工具綁住,這絕對值得一試。你的聲音與檔案都屬於你。VoiceStudio 只是把這件事變成實際的日常。

相關文章