TTS 聲音克隆
上傳參考音訊、對上參考文本,再輸入要唸的稿,即可用該音色合成。內建音色可直接選;進階參數與自訂 JSON 給需要穩定 seed 與長度控制的人。
完全本機的 AI 音訊工作站 — 克隆、轉寫、作曲與分離,一個引擎全包
Wisdom Audio 是給配音、後製與內容團隊用的本機音訊工作站:語音克隆、語音轉文字、AI 作曲、聲音轉換、音源分離與聲音設計都在同一套原生推論引擎上完成。音檔與權重不出機;CUDA 下合成可比常見 Python 路徑快數倍,長稿也能用數倍即時速度做成播客節奏。介面下載四十餘個模型,並提供與既有腳本相容的本機 API。
TTS 頁上傳參考音、對文本、再合成;ASR 把會議與素材變成逐字稿;作曲與分離給影片床樂和翻唱。進階參數、種子與釋放顯存都在畫面上,換模型不必重開程式。
引擎是 C++ ggml,不是先裝一堆 Python 套件才能出聲。桌面一鍵啟動後,本機 API 就能被自動化呼叫。以下按合成、轉寫變聲、音樂設計與引擎串接逐項說明。

依模組列出此產品的每一項能力。
上傳參考音訊、對上參考文本,再輸入要唸的稿,即可用該音色合成。內建音色可直接選;進階參數與自訂 JSON 給需要穩定 seed 與長度控制的人。
VibeVoice 類模型可把長稿做成播客節奏的語音,CUDA 下可達數倍即時速度。適合有聲書、口播稿與產品解說,不必把音檔送上雲端。
合成語言可指定,中文稿與英文稿走同一條工作流。克隆與語種是分開的旋鈕,避免「音色對了但語言錯了」。
把會議、訪談或素材音軌轉成文字,資料不出機。後製字幕、會議紀錄與內容再製都從同一條轉寫結果開始。
保留語句內容,改說話人的音色特徵。適合配音替換、角色統一或把同一條旁白試不同聲線,而不重錄整段。
在同一套工作站裡生成配樂與片段,給影片、播客或產品 Demo 當床樂。不必先開第二套雲端作曲訂閱。
把人聲、伴奏或其他層從混音裡拆出來,供後製、翻唱或清理現場錄音。分離結果留在本機,方便接到剪輯時間軸。
針對素材做聲音設計與技術分析,而不是只有「一鍵出聲」。需要聽頻譜、對齊長度或調音色時,工具就在同一個頂欄模組裡。
ggml 引擎在本機跑完推論,不必先建 Python 環境、也不把音訊上傳。CUDA 加速下 TTS 可比常見 Python 路徑快數倍。
模型清單、下載進度、載入與釋放顯存都在畫面上。做完一項工作可釋放 VRAM,再換另一個模型,不必重開程式。
把合成與轉寫掛進既有腳本或產品:請求打到本機端點,金鑰與音檔都不出機。桌面版一鍵 Start 即可連上。