藍圖 — 完整語音涵蓋
目標: 讓問答中出現的每一則教法 — 無論是書籍章節或電子書段落 — 都能聆聽,而不只是閱讀。 有製作 Podcast 者沿用之,無者則產生朗讀。
本頁為對外摘要;實作細節保留於工程儲存庫中。
設計原則
- 離線優先。 語音以批次方式產出並存為檔案,請求路徑中不做即時合成,讓回答保持迅速, 也讓音檔易於搬移。
- 可鍵值化、可快取。 每段音檔繫於一個嗓音身分與其來源文字,因此可重新產製或搬遷, 無需重新推導任何內容。
- 與閱讀器一致。 產出的語音使用與閱讀器相同的文字,聽到的與看到的一致。
嗓音方式
我們評估了兩套開放、寬鬆授權的合成系統,比較其品質與重現特定嗓音的能力。評估結果:
- 零樣本(zero-shot)語音複製 — 以單一乾淨的參考片段產生嗓音、無須訓練 — 在來源為 早期典藏音檔時,品質可媲美甚至勝過微調模型。
- 決策: 採用零樣本複製作為合成方式。剩下的品質關鍵是參考片段的選擇,而非訓練。
上線階段
- 為尚無音檔的章節與電子書提供中性/旁白嗓音。
- 法師本人嗓音,以取得相關機構授權為前提。
各階段皆產出標準音檔,接入現有閱讀器 — 即目前 Podcast 章節已使用的播放列 — 因此無需 新增任何播放機制。
現況
規劃與嗓音評估已完成:
- 離線優先的設計已定案 — 產出的語音以檔案形式接入現有閱讀器,因此加入語音不引入任何 即時服務。
- 合成方式已定案 — 採零樣本語音複製,參考片段為唯一的品質關鍵。
上線前尚待:正式語音產製本身,以及 — 就法師本人嗓音而言 — 取得相關機構授權。在此之前 現有行為不變。