Perso Dubbing / 模型

認識全新高階配音引擎。

認識全新高階配音引擎。

Nightingale

Nightingale

Nightingale

Nightingale 是專為重視情感表達的內容打造的高階 AI 配音引擎。比較各模型的優勢與實際影片評估結果,選擇適合您內容的配音模型。

Nightingale 是專為重視情感表達的內容打造的高階 AI 配音引擎。比較各模型的優勢與實際影片評估結果,選擇適合您內容的配音模型。

為您的內容
找到合適的模型。

為您的內容
找到合適的模型。

從製作需求出發:情感豐富的演出、面向在地觀眾的內容、自己的聲音,或穩定的旁白。以下卡片的分數均來自同一組內部影片資料。

戲劇、娛樂節目與情感豐富的演出

Nightingale

適合希望以高階品質傳達情緒起伏的創作者與工作室。Nightingale 在兩種受測語言中,原始表現追蹤的平均分數皆居首位。

內部影片 · 表現追蹤:英語 0.45、韓語 0.54。這些分數衡量聲音強度,而非整體品質。

課程、企業影片與在地觀眾

Oriole

根據聆聽評估,具備讓在地觀眾聽來自然的口音。需要句與句之間聲音一致的課程和企業影片,可選擇 Oriole。

內部影片 · 英語聲音一致性:0.661,平均最高。韓語一致性則以 Wren 領先。

自己的聲音、訪談與大量製作

Finch

適合希望在訪談或整個頻道配音中保留自己聲音的創作者。Finch 的英語說話者相似度平均最高,以保留聲音與低成本製作為設計重點。

內部影片 · 英語說話者相似度:0.564。重點為保留聲音與低成本;發布前請確認英語和西班牙語口音。

課程、企業旁白與穩定朗讀

Wren

適合需要穩定旁白的教育者與企業。Wren 適用於課程講稿、企業介紹及朗讀內容,在內部影片資料中,韓語聲音一致性的平均分數最高。

內部影片 · 韓語聲音一致性:0.713。英語自然度預測:3.64/5,屬於自動評分,而非聆聽評估。

Dodo 是上一代 Expressive 模型,納入基準測試以提供比較背景。模型供應情況與使用條件請見產品內說明。

我們如何評估配音

聲音相似度。
表現。一致性。

聲音相似度。
表現。一致性。

配音品質有多個面向。我們評估聲音像誰、如何跟隨原聲的表達,以及在整個場景中是否一致。我們也檢視翻譯、語音辨識錯誤與時間對齊。

01

說話者相似度

配音後的聲音仍然像原說話者嗎?

與原始說話者的聲音相似度

02

表達

聲音強度是否跟隨原聲的演繹?

喚醒度相關性 · 音高分析

03

一致性

生成的聲音在不同台詞之間是否保持一致?

連續台詞間的聲音相似度

引擎團隊基準測試 · 2026年9月22日

探索測量結果。

選擇資料集、目標語言與指標,即可比較模型。分數採用各指標所列的尺度與評估條件。

模型
00.250.50.751
平均值
Wren0.341
Dodo0.353
Oriole0.323
Finch0.564
Nightingale0.414

來源:Perso 引擎團隊基準測試,2026 年 9 月 22 日修訂。醒目列為所選指標中平均值最佳的模型;同分者一併標示。這不代表統計顯著性或整體品質優勢。

結果解讀

Finch 在公開朗讀資料的四種目標語言及內部英語影片中,平均分數皆最高。內部韓語影片中,Nightingale 為 0.486,Finch 為 0.483,結果接近。

評估條件

公開朗讀資料:13 組語言配對,來源語言為韓語、英語、葡萄牙語與中文,目標語言為英語、西班牙語、葡萄牙語與韓語。結果按朗讀者群組取平均。內部影片:29 組配音配對,其中 16 組配成英語、13 組配成韓語。

FLEURS 為 Wren、Dodo、Oriole 和 Finch 提供逐字稿與時間資訊,並共用固定翻譯。Nightingale 自行執行語音辨識與翻譯。FLEURS 以前四者的乾淨逐句片段評分;Nightingale 輸出先分離人聲,再對齊原句時間區間。內部影片由各模型自行翻譯,所有模型皆以完整音軌評估語音辨識錯誤。

公開朗讀資料採 CC BY 4.0 授權。結果涵蓋特定語言與內容,而非所有製作情境。不計算模型綜合排名。

評估資料與方法

評估資料與方法

卡片分數來自同一組內部影片資料。比較工具亦包含公開朗讀資料。口音品質則以獨立的聆聽評估為依據。

13

FLEURS 語言對

公開朗讀語音資料。來源語言為韓語、英語、葡萄牙語和中文;目標語言為英語、西班牙語、葡萄牙語和韓語。每種來源語言 64 句,依朗讀者分組。CC BY 4.0。

29

內部影片對

另一組接近客戶使用情境的影片,包含 16 對英語配音與 13 對韓語配音。評估時間限制更緊、音訊條件更多元的內容。

這些結果能告訴您什麼

FLEURS 評估為 Wren、Dodo、Oriole 和 Finch 提供逐字稿、時間資訊和共用翻譯。Nightingale 自行進行語音辨識與翻譯。這是在明示條件下的完整流程結果,不是單獨控制 TTS 的比較。

聆聽評估:在 2026 年 9 月的盲測評審中,Oriole 的外國口音被指出比例最低,為 8%。這是聆聽評審的結果,而非自動口音評分。單一指標無法涵蓋完整的聆聽體驗。

來源:Perso 引擎團隊基準測試,2026 年 9 月 22 日修訂。卡片分數:內部影片,16 組英語與 13 組韓語配音配對。微小的平均差異不足以證明可靠優勢。點數使用量請於使用產品時確認。

配音品質常見問題

配音品質常見問題

高階是否代表每個指標都最高分?

不是。Nightingale 是我們的高階引擎產品,但不同模型在不同指標上領先。說話者相似度、表達、翻譯與時間對齊應分別考量。

為什麼將測量與聆聽分開?

自動指標檢視特定訊號,無法完整捕捉流暢度、情感細節或演繹是否適合場景。實際聆聽仍不可或缺。

基準測試語言代表所有支援語言嗎?

不是。此處 FLEURS 結果涵蓋四種目標語言,內部影片涵蓋英語與韓語。不應推廣至所有語言或內容類型。

選擇模型,
開始配音。

選擇模型,
開始配音。

探索 Perso Dubbing,為下一個專案選擇合適的模型。

探索 Perso Dubbing →