微軟開源 TTS:VibeVoice

微軟幾天前發布了新的開源 TTS 技術 VibeVoice,旨在解決傳統 TTS 會面臨的以下問題:

  1. 長文本不穩定:遇到較長的對話容易不穩、且情感缺失。
  2. 多人說話限制:多數模型僅支援 1-2 位說話者,難應對Podcast、 劇本等複雜場景。
  3. 語音一致性不足:同一角色不同段落的聲音風格難以保持統一。
  4. 互動與轉場生硬:自然對話、情感流動及音效插入仍不成熟。

官方說可製作長達 90 分鐘、最多 4 位說話者 的連續語音,還滿令人期待的,這樣之後就可以文字稿的方式,生成一整集 Podcast 或有多角色的有聲小說,還不需人工剪接,比以前在實作上要拼接多段 TTS 的輸出,且一致性難控來說方便很多。

VibeVoice 有 7B 跟 1.5B 的,1.5B 的可以去 Colab 試試

架構設計跟我的心得貼在: https://reurl.cc/lYX5jE

之前我大多用 GPT Sovit、11labs 等,歡迎對 TTS/ASR 有興趣的人一起來討論相關應用 :)