感情豊かな演技、現地の視聴者向けコンテンツ、自分の声、安定したナレーション。制作目的から選びましょう。以下のカードのスコアは、すべて同じ社内動画セットに基づきます。
ドラマ・エンタメ・感情豊かな演技
Nightingale
感情の起伏までプレミアムな表現で伝えたいクリエイターやスタジオに。Nightingaleは、評価した両言語で元の表現の追従度が平均1位でした。
社内動画 · 表現の追従度:英語 0.45、韓国語 0.54。声の強弱を測るスコアであり、総合品質ではありません。
講義・企業動画・現地の視聴者向けコンテンツ
Oriole
聴取評価に基づく、現地の視聴者に自然に聞こえるアクセント。文と文の間でも一貫した声が必要な講義や企業動画にはOrioleを。
社内動画 · 英語の声の一貫性:0.661、平均1位。韓国語の一貫性はWrenが最高でした。
自分の声・インタビュー・大量制作
Finch
インタビューやチャンネル全体の吹き替えで自分の声を保ちたいクリエイターに。Finchは英語の話者類似度で平均1位を記録し、声の維持と低コストでの制作を目指して設計されています。
社内動画 · 英語の話者類似度:0.564。声の維持と低コストが強みです。英語・スペイン語のアクセントは公開前にご確認ください。
講義・企業ナレーション・安定した読み上げ
Wren
安定したナレーションを求める教育者や企業に。Wrenは講義原稿、企業紹介、読み上げコンテンツに適し、社内動画セットで韓国語の声の一貫性が平均1位でした。
社内動画 · 韓国語の声の一貫性:0.713。英語の自然さ予測:3.64/5。聴取評価ではなく、自動評価スコアです。
Dodoは旧Expressiveモデルで、比較の背景としてベンチマークに含めています。モデルの提供状況と利用条件は製品内でご確認ください。
吹き替えの評価基準
吹き替えの品質には複数の側面があります。誰の声に聞こえるか、原音の表現をどう追従するか、シーン全体でどれほど一貫しているかを評価します。翻訳、音声認識誤り、タイミングも検証します。
01
話者の類似度
吹き替え後も元の話者の声に似ていますか?
元の話者との声の類似度
02
表現
声の強さは原音の演技に追従していますか?
覚醒度の相関 · ピッチ分析
03
一貫性
生成した声は台詞が変わっても一貫していますか?
連続する台詞間の音声類似度
エンジンチームのベンチマーク · 2026年9月22日
測定結果を見る。
データセット、対象言語、評価項目を選んでモデルを比較できます。スコアには各項目に表示された尺度と評価条件を用いています。
| モデル | 00.250.50.751 | 平均 |
|---|---|---|
| Wren | 0.341 | |
| Dodo | 0.353 | |
| Oriole | 0.323 | |
| Finch | 0.564 | |
| Nightingale | 0.414 |
出典:Persoエンジンチームのベンチマーク、2026年9月22日修正。選択した指標で最良の平均値を持つ行を強調し、同点はともに表示します。統計的有意差や総合品質の優位性を意味しません。
Finchは公開読み上げデータの4対象言語と社内英語動画で平均が最高でした。社内韓国語動画ではNightingaleが0.486、Finchが0.483と近い結果です。
評価条件
公開読み上げデータ:13言語ペア。原文言語は韓国語・英語・ポルトガル語・中国語、対象言語は英語・スペイン語・ポルトガル語・韓国語です。結果は読み手グループごとに平均します。社内動画:英語16ペア、韓国語13ペア、計29ペアの吹き替え結果。
FLEURSではWren、Dodo、Oriole、Finchに書き起こしとタイミングを提供し、固定の翻訳を共有します。Nightingaleは独自に音声認識と翻訳を行います。FLEURSでは前者4モデルをクリーンな台詞別クリップで評価し、Nightingaleの出力は音声分離して原文の時間枠に整合させます。社内動画では各モデルが独自に翻訳し、全モデルの音声認識誤りをトラック全体で評価します。
公開読み上げデータはCC BY 4.0ライセンスです。結果は選定した言語とコンテンツに限られ、すべての制作場面を網羅しません。モデルの総合順位は算出していません。
カードのスコアは同じ社内動画セットに基づきます。比較表には公開読み上げデータも含まれます。アクセント品質は、別途行った聴取評価を根拠としています。
13
FLEURSの言語ペア
公開の読み上げ音声データです。原言語は韓国語、英語、ポルトガル語、中国語、対象言語は英語、スペイン語、ポルトガル語、韓国語です。原言語ごとに64文を読み手別にグループ化しました。CC BY 4.0。
29
社内動画ペア
顧客のコンテンツに近い別の動画セットで、英語への吹き替え16ペアと韓国語への13ペアを含みます。時間制約が厳しく、音響条件がより多様なコンテンツを評価します。
この結果から分かること
FLEURSではWren、Dodo、Oriole、Finchに書き起こしとタイミング、共通の翻訳を提供します。Nightingaleは独自に音声認識と翻訳を行います。これは記載した条件下での処理工程全体の結果であり、TTSだけを切り離した統制比較ではありません。
聴取評価:2026年9月のブラインド評価で、Orioleの外国語訛りの指摘率は8%と最も低い結果でした。自動アクセントスコアではなく、聴取パネルの評価です。単一の指標で聴取体験のすべてを表すことはできません。
出典:Persoエンジンチームのベンチマーク、2026年9月22日修正。カードのスコア:社内動画の英語16ペア・韓国語13ペアの吹き替え結果。小さな平均差だけでは確かな優位性は示せません。クレジット使用量は製品のご利用時にご確認ください。
プレミアムならすべての指標で最高スコアですか?
いいえ。Nightingaleはプレミアムエンジンとして提供していますが、指標によって先行するモデルは異なります。話者類似度、表現、翻訳、タイミングは個別に検討する必要があります。
測定と聴取を分ける理由は?
自動指標は特定の信号を調べます。流れ、感情のニュアンス、演技がシーンに合うかどうかを完全には捉えられません。実際に聴くことは不可欠です。
評価対象の言語はすべての対応言語を代表しますか?
いいえ。ここでのFLEURSは4つの対象言語、社内動画は英語と韓国語を評価しています。すべての言語やコンテンツに一般化すべきではありません。
Perso Dubbingで次のプロジェクトに合うモデルを選びましょう。
Perso Dubbingを見る →