最近在幫一個朋友。他想把影片做成自動化,稿子寫好、配音交給 AI,一集一集自己產出來。問題是,現成的 AI 聲音講起中文,就是不像台灣人在講話。

所以我想說,那就拿他自己的聲音來做克隆(讓 AI 學他的聲音),這樣總該像了吧?

結果一個晚上盲聽了 9 個克隆模型(從 ElevenLabs、MiniMax、Qwen3,到專門做台灣華語的 BreezyVoice),我才搞懂一件事:聲音像不像,靠克隆;字唸得對不對,靠模型本身。 這兩件事是分開的。

先講結論,給趕時間的人:

  1. 音色靠克隆,讀音靠模型。 用大陸語料訓練的模型(像 MiniMax、Qwen3),就算拿台灣人的聲音去克隆,「垃圾」還是唸成 ㄌㄚ ㄐㄧ。所以要先挑讀音對的模型,再來比像不像。
  2. 參考音越乾淨越好。 沒有背景音樂的 62 秒錄音,比從有配樂的影片裡硬拆出來的人聲好很多。
  3. 先查有沒有新版。 我們花了一個晚上,替 ElevenLabs v3 一個字一個字修讀音,累積了 15 個替代發音的字。後來才發現 ElevenLabs 早就出了 v4,原文直接丟進去就唸得好,完全不用換字。
  4. 稿子改寫也是解法。 怎麼換字都唸不好的詞,直接換一個好唸的說法。
  5. 盲聽,最後以耳朵為準。 讓 AI(Gemini 的音訊理解)幫忙打分數,它幾乎每個都給滿分。

最後定案的是 ElevenLabs 的 v4 模型,加上即時克隆(Instant Voice Clone)。下面照時間順序講,最後一大段留給想知道細節的人。

我要的是什麼

需求其實很簡單:

前一天我先試過幾個內建的台灣聲音(不是克隆,是平台自己準備好的聲音)。我們用 4 個很容易聽出差別的詞當考題:垃圾、企業、危險、星期。Gemini TTS、ElevenLabs 的台灣聲音、Azure 的 HsiaoChen 都是台灣讀法;MiniMax 0 題,Fish Audio 也是大陸讀法。這時候我就有預感,讀音這關會很難過。

第一輪:拿有配樂的影片來克隆

朋友手上本來就有幾支他自己講話的短片,但都有背景音樂。我們先用 demucs(人聲分離模型)把人聲從音樂裡拆出來(大約 95 秒),再拿去克隆。

5 個模型、各配 2 集,總共 10 段:MiniMax Speech 2.8 HD、Qwen3-TTS 1.7B、IndexTTS 2、VibeVoice 7B、Chatterbox 多語版,全部在雲端平台 fal 上跑(原本排的 BreezyVoice 40 分鐘沒裝好,那 2 集先用 Chatterbox 頂上)。每一段只標編號,我聽完、打完分數,才揭曉是哪個模型。這輪花了大約 US$2.06。

我挑出來「可以」的 2 段,揭曉後剛好都是 MiniMax;「可以考慮」的 2 段,是 IndexTTS 2 和 Qwen3。聽起來好像有進展。

第二輪:換乾淨的參考音

後來我又找到 3 支沒有背景音樂的影片,加起來大約 62 秒,只做轉單聲道、裁掉靜音、調音量這種基本處理,就再跑一次。同一套分派方式,又花了大約 US$2.02。

差別很明顯。Qwen3 同一集的評價,從「不行」直接變成「可以考慮」。參考音乾不乾淨,影響比我想像的大。

決選:兩個都被讀音打掉

前兩輪表現最好的 MiniMax 和 Qwen3,進入決選。這次我用一句專門設計的讀音測試句,再加兩集正片,一樣盲聽,兩個只標 X、Y。

結果兩個都不行。音色是像的,但一開口就是大陸讀音。

這時候我才想通:這兩個模型都是用大陸語料訓練的。克隆只學得到「聲音長什麼樣子」,學不到「這個字在台灣怎麼唸」。音色和讀音,根本是兩件事。

換一家:新舊版本差很多

我升級了 ElevenLabs 的入門方案 Starter(第一個月 US$1,之後每月 US$6),用即時克隆(Instant Voice Clone)再試:

同一時間,我也在自己電腦上裝了一個專門為台灣華語做的開源模型(BreezyVoice)。它的讀音是對的,但背景有嗡嗡聲、停頓也怪;而且那時候顯示卡被占用,只能用 CPU 跑,一段要 12~20 分鐘。

最後一輪 ElevenLabs v3 對 BreezyVoice 盲聽,我選了 v3,決定用「換字」把唸錯的地方修掉。

一個晚上都在換字

換字的意思是:稿子和字幕不動,只把送給 AI 的那份文字,換成它會唸對的同音字。例如:

一集一集聽、一集一集修,修到第 7 集,已經累積 15 個替代發音的字,再加 2 處直接改寫。

最麻煩的是要換聲調的替代發音的字。像「跟著」要改送「根者」才唸得對,可是換了聲調的字,放到別的句子又會怪,所以只能一句一句看,不能整份稿子套用。

還有怎麼換字都救不回來的。「國中」我們試了幗、虢、蟈、摑、郭,連拼音都試了,全部不行。最後乾脆改稿子,寫成「以前念書的時候」,問題就沒了。

早就有新版了

修到半夜,我派了一個 Claude Code 的研究子代理去查,別人遇到中文讀音都怎麼解。

它查回來三件事。第一,同音字替換是很多人都在用的土方法,不是只有我們這樣搞。第二,ElevenLabs 在 9 月 28 日已經發布了 v4(API 上的模型代號是 eleven_v4),我們整晚修的是上一代 v3。第三,Gemini 3.8 TTS 也有聲音複製,這次沒有測到。

凌晨就先用 v4 做了三段試聽,原文直接送,完全不換字。我隔天早上起來聽完,感想是:「念得非常好。」

就這樣定案:ElevenLabs v4+即時克隆。10 集全部用 v4 重配,每集 33~40 秒,跟原本的配音長度幾乎一樣。前一晚修的 15 個替代發音的字,全部用不到了。

我現在的做法

如果你也要用 AI 做中文配音,這是我會照的順序:

  1. 先查各家(ElevenLabs、MiniMax、Gemini……)最近一個月有沒有出新版。 這一步 5 分鐘,可能省掉你一整晚。
  2. 先用讀音測試句篩模型,再比音色。 讀音不對的,聲音再像都沒用。
  3. 參考音用沒有背景音樂的乾淨錄音,30~60 秒以上,語氣接近你要的成品。
  4. 唸不好的詞,先改寫稿子,不要硬換字。 換一個好唸的說法,通常比找同音字快。
  5. 盲聽。 每一段只標編號,聽完、打完分數,才看是哪個模型。

你可以這樣自己測

把下面這段話丟給你想用的 AI 配音工具,聽它怎麼唸:

> 垃圾分類記得做好,星期三見。企業合作請聯絡我們,危險的動作不要做。

注意聽「垃圾」「星期」「企業」「危險」這 4 個詞。有任何一個唸成大陸讀法,那個模型就算克隆得再像,正片裡也會一直冒出來。

想知道細節的人看這裡

上面是照著做就好的版本。這一段是過程中的細節和數字,不看也不影響。

這次試過的克隆模型

模型我的評價結果主要問題
ElevenLabs v4(即時克隆)念得非常好採用不用換字;入門方案只能輸出 128k
ElevenLabs v3(即時克隆)讀音還可以被 v4 取代單字常唸錯,修到第 7 集就要 15 個替代發音的字
ElevenLabs Multilingual v2不行淘汰—
BreezyVoice(本機)讀音正確備案背景嗡嗡聲、停頓怪;只用 CPU 時很慢
MiniMax Speech 2.8 HD第一輪可以,決選不行淘汰大陸讀音;克隆一次 US$1.5,7 天沒用會失效
Qwen3-TTS 1.7B可以考慮,決選不行淘汰大陸讀音;會吃掉稿子最後 1~2 個字
IndexTTS 2可以考慮淘汰語尾平淡
VibeVoice 7B不行淘汰電子感
Chatterbox 多語版不行淘汰斷句破碎

這是我們這一次、同一份稿子、同一段參考音、我一個人盲聽的結果,不是通用排名。換了稿子、換了聲音,結果可能不一樣。

為什麼讓 AI 打分數不準

我們也試過讓 AI 聽音檔打分數(用 Gemini 的音訊理解)。「像不像本人」這一項,它幾乎每一段都給 5 分;讀音對不對,換一個問法,答案就變了。所以最後還是以耳朵為準。

另外一個發現:盲聽真的有用。我在不知道是哪個平台的情況下,兩輪挑出來的都集中在同樣幾個模型,判斷前後是一致的。

替代發音的字,兩條規矩

換字只改送給 AI 的文字,稿子和字幕都不動。我們把它寫成一份替代發音字對照表,讓程式在送出前自動換。

平台的發音字典,對中文有用嗎?

ElevenLabs 有「發音字典」,分兩種規則:一種是文字替換(跟我們的換字一樣,只是搬到平台上管理),所有模型都能用;另一種是音標,官方文件寫只有部分模型吃,而且英文以外的語言要用 v4。我們查的時候,官方文件沒有任何中文聲調的範例,也沒找到別人公開的中文實測,所以這一段我們沒有驗證過。

參考音怎麼準備

如果手上只有帶配樂的影片,可以先用人聲分離工具(我們用 demucs,在 fal 上跑)把聲音拆出來,但效果比不上直接錄一段乾淨的。

這次花了多少

項目大約
fal 雲端跑模型(第一輪、第二輪、決選;含 MiniMax 克隆一次 US$1.5)US$4.3
ElevenLabs Starter 方案第一個月 US$1,之後每月 US$6;這次用掉約 9,000 字的額度(估算),每月額度 30,000 字
研究用的資料查詢(treg)約 US$0.04

本機跑的 BreezyVoice 不用付費,代價是時間:用 CPU 跑,一段要 12~20 分鐘。