從製作需求出發:情感豐富的演出、面向在地觀眾的內容、自己的聲音,或穩定的旁白。以下卡片的分數均來自同一組內部影片資料。
戲劇、娛樂節目與情感豐富的演出
Nightingale
適合希望以高階品質傳達情緒起伏的創作者與工作室。Nightingale 在兩種受測語言中,原始表現追蹤的平均分數皆居首位。
內部影片 · 表現追蹤:英語 0.45、韓語 0.54。這些分數衡量聲音強度,而非整體品質。
課程、企業影片與在地觀眾
Oriole
根據聆聽評估,具備讓在地觀眾聽來自然的口音。需要句與句之間聲音一致的課程和企業影片,可選擇 Oriole。
內部影片 · 英語聲音一致性:0.661,平均最高。韓語一致性則以 Wren 領先。
自己的聲音、訪談與大量製作
Finch
適合希望在訪談或整個頻道配音中保留自己聲音的創作者。Finch 的英語說話者相似度平均最高,以保留聲音與低成本製作為設計重點。
內部影片 · 英語說話者相似度:0.564。重點為保留聲音與低成本;發布前請確認英語和西班牙語口音。
課程、企業旁白與穩定朗讀
Wren
適合需要穩定旁白的教育者與企業。Wren 適用於課程講稿、企業介紹及朗讀內容,在內部影片資料中,韓語聲音一致性的平均分數最高。
內部影片 · 韓語聲音一致性:0.713。英語自然度預測:3.64/5,屬於自動評分,而非聆聽評估。
Dodo 是上一代 Expressive 模型,納入基準測試以提供比較背景。模型供應情況與使用條件請見產品內說明。
我們如何評估配音
配音品質有多個面向。我們評估聲音像誰、如何跟隨原聲的表達,以及在整個場景中是否一致。我們也檢視翻譯、語音辨識錯誤與時間對齊。
01
說話者相似度
配音後的聲音仍然像原說話者嗎?
與原始說話者的聲音相似度
02
表達
聲音強度是否跟隨原聲的演繹?
喚醒度相關性 · 音高分析
03
一致性
生成的聲音在不同台詞之間是否保持一致?
連續台詞間的聲音相似度
引擎團隊基準測試 · 2026年9月22日
探索測量結果。
選擇資料集、目標語言與指標,即可比較模型。分數採用各指標所列的尺度與評估條件。
| 模型 | 00.250.50.751 | 平均值 |
|---|---|---|
| Wren | 0.341 | |
| Dodo | 0.353 | |
| Oriole | 0.323 | |
| Finch | 0.564 | |
| Nightingale | 0.414 |
來源:Perso 引擎團隊基準測試,2026 年 9 月 22 日修訂。醒目列為所選指標中平均值最佳的模型;同分者一併標示。這不代表統計顯著性或整體品質優勢。
Finch 在公開朗讀資料的四種目標語言及內部英語影片中,平均分數皆最高。內部韓語影片中,Nightingale 為 0.486,Finch 為 0.483,結果接近。
評估條件
公開朗讀資料:13 組語言配對,來源語言為韓語、英語、葡萄牙語與中文,目標語言為英語、西班牙語、葡萄牙語與韓語。結果按朗讀者群組取平均。內部影片:29 組配音配對,其中 16 組配成英語、13 組配成韓語。
FLEURS 為 Wren、Dodo、Oriole 和 Finch 提供逐字稿與時間資訊,並共用固定翻譯。Nightingale 自行執行語音辨識與翻譯。FLEURS 以前四者的乾淨逐句片段評分;Nightingale 輸出先分離人聲,再對齊原句時間區間。內部影片由各模型自行翻譯,所有模型皆以完整音軌評估語音辨識錯誤。
公開朗讀資料採 CC BY 4.0 授權。結果涵蓋特定語言與內容,而非所有製作情境。不計算模型綜合排名。
卡片分數來自同一組內部影片資料。比較工具亦包含公開朗讀資料。口音品質則以獨立的聆聽評估為依據。
13
FLEURS 語言對
公開朗讀語音資料。來源語言為韓語、英語、葡萄牙語和中文;目標語言為英語、西班牙語、葡萄牙語和韓語。每種來源語言 64 句,依朗讀者分組。CC BY 4.0。
29
內部影片對
另一組接近客戶使用情境的影片,包含 16 對英語配音與 13 對韓語配音。評估時間限制更緊、音訊條件更多元的內容。
這些結果能告訴您什麼
FLEURS 評估為 Wren、Dodo、Oriole 和 Finch 提供逐字稿、時間資訊和共用翻譯。Nightingale 自行進行語音辨識與翻譯。這是在明示條件下的完整流程結果,不是單獨控制 TTS 的比較。
聆聽評估:在 2026 年 9 月的盲測評審中,Oriole 的外國口音被指出比例最低,為 8%。這是聆聽評審的結果,而非自動口音評分。單一指標無法涵蓋完整的聆聽體驗。
來源:Perso 引擎團隊基準測試,2026 年 9 月 22 日修訂。卡片分數:內部影片,16 組英語與 13 組韓語配音配對。微小的平均差異不足以證明可靠優勢。點數使用量請於使用產品時確認。
高階是否代表每個指標都最高分?
不是。Nightingale 是我們的高階引擎產品,但不同模型在不同指標上領先。說話者相似度、表達、翻譯與時間對齊應分別考量。
為什麼將測量與聆聽分開?
自動指標檢視特定訊號,無法完整捕捉流暢度、情感細節或演繹是否適合場景。實際聆聽仍不可或缺。
基準測試語言代表所有支援語言嗎?
不是。此處 FLEURS 結果涵蓋四種目標語言,內部影片涵蓋英語與韓語。不應推廣至所有語言或內容類型。
探索 Perso Dubbing,為下一個專案選擇合適的模型。
探索 Perso Dubbing →