認識 VoiceStudio:免費、本機優先的語音複製,支援 646 種語言
告別每月語音 AI 帳單
老實說:最受歡迎的語音生成工具雖然強大,但它們對待你就像跳錶計費的計程車。你輸入的每個字元都要花錢。你上傳的每個音訊檔案都會送到遠端伺服器處理。如果你想要高品質的語音複製,就逃不掉訂閱制,或是在最糟的時刻撞上使用量上限。
VoiceStudio 是一款開源桌面應用程式,專為打破這種循環而打造。它完全免費,執行在你自己的硬體上,把你的電腦變成一座完整的語音製作工作室。沒有訂閱,沒有使用量計算。只有乾淨的本機音訊——基本上就跟聽起來一樣解放。
VoiceStudio 究竟能做什麼?
最核心的功能是語音複製:錄下任何說話者 3 秒鐘的聲音,把檔案拖入,軟體就會以零樣本學習重新建立那個聲音。你甚至可以用同一個複製的聲音生成 646 種語言的語音。
但那只是這間工作室的其中一個房間。VoiceStudio 還包含:
還有話者分離(speaker diarization)功能、可批次處理數十支影片的佇列、看不見的 AI 浮水印,以及一套診斷工具,讓你不用聯絡支援就能排除問題。
實際比較:VoiceStudio 與 ElevenLabs
VoiceStudio 背後的開發者坦承,在英文 TTS 的開箱即用精緻度方面,ElevenLabs 仍然領先。真正的差異在於結構性。
ElevenLabs 只提供少數語言和單一黑箱模型。VoiceStudio 則支援 646 種語言、16 個 TTS 引擎和 11 個 ASR 引擎。你可以從簡單的設定選單切換到 OmniVoice、CosyVoice、GPT-SoVITS、VoxCPM2 等許多引擎。一切都在本機執行,因此你的音訊永遠不會離開電腦,也不會有逐字計費的問題。
代價也可預期:因為模型是在本機執行,輸出品質取決於你的顯示卡和參考音訊。乾淨、近距離錄製的音訊能帶來令人驚豔的複製效果;吵雜或迴音嚴重的參考檔就沒那麼出色。但一旦你用在自己的內容上,很快就會知道它是否適合你——許多使用者在用 VoiceStudio 一個星期後,就刪除了 ElevenLabs 訂閱。
開始使用有多簡單?
選擇你的作業系統(Windows、macOS ARM 或 Linux)並下載最新安裝程式。在第一次啟動時,VoiceStudio 會建立本機 Python 環境並下載模型權重。只需要幾分鐘,之後就完成了。
接著,用三個步驟複製聲音:
- 開啟「語音複製」工作區。
- 放入任何說話者的 3 秒音訊範例。
- 輸入一個句子,然後按「Generate」。
就是這樣。產生的音訊會在裝置上生成並儲存,開箱即支援 646 種語言。
想知道它能跑多快嗎?文件中有基準測試和效能頁面,確切說明生成時間用在哪裡——包括三個經典的變慢原因。這正是大多數商業工具從不分享的透明度。
只能用本機模型嗎?不——你可以選擇引擎
VoiceStudio 搭載一套穩健的預設組合:TTS 用 OmniVoice,語音轉文字用 WhisperX。但這個應用程式內含 16 個 TTS 引擎和 11 個 ASR 引擎,全部都可以在「設定」中切換。想要 Apple Silicon 加速?MLX-Audio 原生支援 macOS。需要快速的英文模型?Parakeet TDT 即使在 CPU 上也能以約十倍的即時速度運作。甚至還有 OpenAI 相容的 ASR 引擎,可連到遠端的 Qwen3-ASR 或任何相容伺服器。
每個引擎的授權與硬體支援各不相同。README 內有完整矩陣表,讓你知道 GPT-SoVITS 和 NVIDIA CUDA 搭配良好,而 MLX-Audio 僅限 Apple Silicon 使用。這種彈性讓 VoiceStudio 比商業語音網站更具多用途性。
透過 API 整合進你的工作流程
你已經有能和 OpenAI 音訊 API 溝通的腳本或代理程式了嗎?把它指向 http://localhost:3900/v1,你甚至不需要 API 金鑰。VoiceStudio 實作了相容的 /v1/audio/speech 和 /v1/audio/transcriptions 端點,並將它們對應到你在應用程式中啟用的任何 TTS 與 ASR 引擎。它甚至透過自訂的 /v1/audio/voices 端點列出你複製好的聲音。
如果你偏好更深入的 REST API,全部 100 多個端點都可在「設定」中的內建 OpenAPI 參考資料取得。另外也支援代理工具:你可以把 VoiceStudio 的技能安裝到 Claude Code、Cursor 或任何 MCP 用戶端,讓 AI 代理程式能免費、離線地在你本機合成語音。加上聽寫工作流程,你就有了得力助手。
VoiceStudio 為誰而做?
VoiceStudio 非常適合剪輯本機影片的 YouTuber、希望更充分掌控 AI 朗讀的有聲書作者、創作對話的遊戲開發者,或任何想在本機嘗試語音 AI 的好奇人士。如果你注重隱私,這是個好消息:應用程式在傳送任何統計資料前都會明確詢問;如果你拒絕,就什麼都不會傳送。你的文字、音訊、聲音和專案永遠不會離開裝置。
在硬體上,你至少需要 8 GB 記憶體和 10 GB 磁碟空間。搭配 4 GB VRAM 的獨立顯示卡就足以入門;而就算只有 CPU 的機器也能跑完整個流程——只是會慢一些。
結論
VoiceStudio 仍處於活躍的 beta 階段,因此請預期偶爾會出現錯誤,也需要一點學習曲線。但以這個採用 AGPL-3.0 免費開源授權的專案而言,功能豐富到近乎誇張:646 種語言、本機語音複製、有聲書製作、影片配音、聽寫、批次處理與開放 API——全部收在直覺化的桌面 UI 中。
如果你一直覺得被封閉的雲端語音工具綁住,這絕對值得一試。你的聲音與檔案都屬於你。VoiceStudio 只是把這件事變成實際的日常。
相關文章
LocalAI:在任何硬體上運行 LLM、圖像與影片,無需 GPU
LocalAI 是開源、可自架的 AI 引擎,能在任何硬體上運行 LLM、圖像/影片/語音模型 — 無需 GPU。透過 Docker 安裝,載入任何模型,同時讓資料保持私密。
Deep-Live-Cam 2.1.6:一張照片即可即時換臉
探索 Deep-Live-Cam,這款開源工具只需一張圖片就能即時換臉。了解如何安裝並負責任地使用它。
Hermes Agent:從每項任務中學習的自我改進AI
Hermes Agent是來自Nous Research的開源AI代理,它會隨著時間學習技能、記住你的上下文,並能在手機、筆記型電腦或5美元VPS上執行。
Humanizer:讓 AI 寫作聽起來像真人撰寫的開源工具
Humanizer 使用維基百科「Signs of AI writing」(AI 寫作跡象)中的 35 種模式,將 AI 味文字改寫成自然、如真人撰寫的散文。了解運作原理、前後對比範例與安裝步驟。