Wisdom Lab Tech
登入
← 回到產品總覽
WA

Wisdom Audio

完全本機的 AI 音訊工作站 — 克隆、轉寫、作曲與分離,一個引擎全包

已發布音訊 AI

產品介紹

Wisdom Audio 是給配音、後製與內容團隊用的本機音訊工作站:語音克隆、語音轉文字、AI 作曲、聲音轉換、音源分離與聲音設計都在同一套原生推論引擎上完成。音檔與權重不出機;CUDA 下合成可比常見 Python 路徑快數倍,長稿也能用數倍即時速度做成播客節奏。介面下載四十餘個模型,並提供與既有腳本相容的本機 API。

TTS 頁上傳參考音、對文本、再合成;ASR 把會議與素材變成逐字稿;作曲與分離給影片床樂和翻唱。進階參數、種子與釋放顯存都在畫面上,換模型不必重開程式。

引擎是 C++ ggml,不是先裝一堆 Python 套件才能出聲。桌面一鍵啟動後,本機 API 就能被自動化呼叫。以下按合成、轉寫變聲、音樂設計與引擎串接逐項說明。

Wisdom Audio

主要特色

  • TTS 克隆、ASR 轉寫、作曲、變聲、分離與聲音設計同一工作站
  • 本機原生推論,CUDA 下合成可達數倍速度,音檔不上雲
  • 四十餘個模型從介面下載、載入與釋放顯存
  • 本機 API 可接既有腳本;桌面版一鍵啟動

系統需求

  • macOS / Windows

功能一覽

依模組列出此產品的每一項能力。

語音合成與克隆

TTS 聲音克隆

上傳參考音訊、對上參考文本,再輸入要唸的稿,即可用該音色合成。內建音色可直接選;進階參數與自訂 JSON 給需要穩定 seed 與長度控制的人。

長內容生成

VibeVoice 類模型可把長稿做成播客節奏的語音,CUDA 下可達數倍即時速度。適合有聲書、口播稿與產品解說,不必把音檔送上雲端。

多語合成

合成語言可指定,中文稿與英文稿走同一條工作流。克隆與語種是分開的旋鈕,避免「音色對了但語言錯了」。

轉寫與變聲

ASR 語音轉文字

把會議、訪談或素材音軌轉成文字,資料不出機。後製字幕、會議紀錄與內容再製都從同一條轉寫結果開始。

聲音轉換

保留語句內容,改說話人的音色特徵。適合配音替換、角色統一或把同一條旁白試不同聲線,而不重錄整段。

音樂與聲音設計

AI 作曲

在同一套工作站裡生成配樂與片段,給影片、播客或產品 Demo 當床樂。不必先開第二套雲端作曲訂閱。

音源分離

把人聲、伴奏或其他層從混音裡拆出來,供後製、翻唱或清理現場錄音。分離結果留在本機,方便接到剪輯時間軸。

聲音設計與分析

針對素材做聲音設計與技術分析,而不是只有「一鍵出聲」。需要聽頻譜、對齊長度或調音色時,工具就在同一個頂欄模組裡。

本機引擎與串接

原生 C++ 推論

ggml 引擎在本機跑完推論,不必先建 Python 環境、也不把音訊上傳。CUDA 加速下 TTS 可比常見 Python 路徑快數倍。

四十餘個模型從介面下載

模型清單、下載進度、載入與釋放顯存都在畫面上。做完一項工作可釋放 VRAM,再換另一個模型,不必重開程式。

OpenAI 相容本機 API

把合成與轉寫掛進既有腳本或產品:請求打到本機端點,金鑰與音檔都不出機。桌面版一鍵 Start 即可連上。