Beginnen Sie mit Ihrem Einsatz: emotionale Darbietungen, Inhalte für lokale Zielgruppen, Ihre eigene Stimme oder gleichmäßige Erzählungen. Alle Kartenwerte basieren auf demselben internen Videodatensatz.
Drama, Unterhaltung und emotionale Darbietungen
Nightingale
Für Kreative und Studios, die emotionale Höhen und Tiefen in Premiumqualität vermitteln möchten. Nightingale erzielt in beiden getesteten Sprachen den höchsten Mittelwert bei der Nachbildung des ursprünglichen Ausdrucks.
Interne Videos · Ausdrucksnachbildung: EN 0.45, KO 0.54. Gemessen wird die Stimmintensität, nicht die Gesamtqualität.
Vorlesungen, Unternehmensvideos und lokale Zielgruppen
Oriole
Ein für lokale Zielgruppen natürlich klingender Akzent, gestützt auf die Hörbewertung. Oriole eignet sich für Vorlesungen und Unternehmensvideos, die eine beständige Stimme von Satz zu Satz benötigen.
Interne Videos · Englische Stimmkonsistenz: 0.661, der höchste Mittelwert. Im Koreanischen führt Wren.
Eigene Stimme, Interviews und große Produktionsmengen
Finch
Für Kreative, die ihre eigene Stimme beim Synchronisieren von Interviews oder eines ganzen Kanals bewahren möchten. Finch erzielte die höchste mittlere Stimmähnlichkeit im Englischen und ist für Stimmerhalt und kostengünstige Produktion konzipiert.
Interne Videos · Englische Stimmähnlichkeit: 0.564. Im Fokus stehen Stimmerhalt und geringe Kosten. Prüfen Sie englische und spanische Akzente vor der Veröffentlichung.
Vorlesungen, Unternehmensnarration und gleichmäßiges Vorlesen
Wren
Für Lehrende und Unternehmen, die eine gleichmäßige Erzählstimme suchen. Wren eignet sich für Vorlesungsskripte, Unternehmensvorstellungen und vorgelesene Inhalte und erreicht die höchste mittlere koreanische Stimmkonsistenz im internen Videodatensatz.
Interne Videos · Koreanische Stimmkonsistenz: 0.713. Vorhergesagte englische Natürlichkeit: 3.64/5, ein automatisierter Wert und keine Hörbewertung.
Dodo ist das frühere Expressive-Modell und wird zur Einordnung im Benchmark mitgeführt. Verfügbarkeit und Nutzungsbedingungen der Modelle finden Sie im Produkt.
So bewerten wir Synchronisation
Synchronisationsqualität hat mehrere Dimensionen. Wir bewerten, wem die Stimme ähnelt, wie sie dem ursprünglichen Ausdruck folgt und wie konsistent sie durch eine Szene trägt. Auch Übersetzung, Spracherkennungsfehler und zeitliche Abstimmung werden untersucht.
01
Stimmidentität
Ähnelt die synchronisierte Stimme weiterhin der ursprünglichen Person?
Ähnlichkeit mit der ursprünglichen Stimme
02
Ausdruck
Folgt die Stimmintensität der ursprünglichen Darbietung?
Korrelation der stimmlichen Aktivierung · Tonhöhenanalyse
03
Konsistenz
Bleibt die erzeugte Stimme von Satz zu Satz einheitlich?
Stimmähnlichkeit aufeinanderfolgender Sätze
Engineering-Benchmark · 22. September 2026
Messwerte erkunden.
Wählen Sie Datensatz, Zielsprache und Kennzahl, um die Modelle zu vergleichen. Die Werte verwenden die jeweils angegebene Skala und die zugehörigen Bewertungsbedingungen.
| Modell | 00.250.50.751 | Mittelwert |
|---|---|---|
| Wren | 0.341 | |
| Dodo | 0.353 | |
| Oriole | 0.323 | |
| Finch | 0.564 | |
| Nightingale | 0.414 |
Quelle: Benchmark des Perso-Engine-Teams, korrigiert am 22. September 2026. Hervorgehobene Zeilen haben den besten Mittelwert für die gewählte Kennzahl; Gleichstände werden gemeinsam markiert. Dies belegt weder statistische Signifikanz noch überlegene Gesamtqualität.
Finch hat den höchsten Mittelwert in allen vier Zielsprachen der öffentlichen Vorlesedaten und in internen englischen Videos. Bei internen koreanischen Videos erreicht Nightingale 0.486 und Finch 0.483; die Ergebnisse liegen nahe beieinander.
Bewertungsbedingungen
Öffentliche Vorlesedaten: 13 Sprachpaare mit Koreanisch, Englisch, Portugiesisch und Chinesisch als Ausgangssprachen und Englisch, Spanisch, Portugiesisch und Koreanisch als Zielsprachen. Mittelwerte werden je Vorlesergruppe gebildet. Interne Videos: 29 Synchronisationspaare, 16 ins Englische und 13 ins Koreanische.
In FLEURS erhalten Wren, Dodo, Oriole und Finch Transkript und Zeitvorgaben und teilen eine festgelegte Übersetzung. Nightingale führt Spracherkennung und Übersetzung selbst durch. Die ersten vier werden anhand sauberer Einzelzeilen-Clips bewertet; Nightingales Ausgabe wird sprachsepariert und an den Zeitfenstern der ursprünglichen Sätze ausgerichtet. Bei internen Videos übersetzt jedes Modell selbst. Dort werden Spracherkennungsfehler bei allen Modellen auf vollständigen Spuren bewertet.
Öffentliche Vorlesedaten stehen unter CC BY 4.0. Die Ergebnisse decken ausgewählte Sprachen und Inhalte ab, nicht alle Produktionsszenarien. Es wird keine Gesamtrangliste der Modelle berechnet.
Die Kartenwerte stammen aus einem gemeinsamen internen Videodatensatz. Der Explorer enthält zusätzlich öffentliche Vorlesedaten. Die Hörbewertung liefert separate Belege zur Akzentqualität.
13
FLEURS-Sprachpaare
Öffentliche Daten vorgelesener Sprache. Ausgangssprachen: Koreanisch, Englisch, Portugiesisch und Chinesisch. Zielsprachen: Englisch, Spanisch, Portugiesisch und Koreanisch. 64 Sätze pro Ausgangssprache, nach Lesenden gruppiert. CC BY 4.0.
29
Interne Videopaare
Ein separater Satz kundentypischer Videos mit 16 Synchronisationspaaren ins Englische und 13 ins Koreanische. Bewertet Inhalte mit engeren Zeitvorgaben und vielfältigeren Audiobedingungen.
Was diese Ergebnisse aussagen
Bei FLEURS erhalten Wren, Dodo, Oriole und Finch Transkripte und Zeitvorgaben sowie eine gemeinsame Übersetzung. Nightingale führt Spracherkennung und Übersetzung selbst durch. Dies sind Ergebnisse vollständiger Prozesse unter dokumentierten Bedingungen, kein kontrollierter Vergleich von isoliertem TTS.
Hörbewertung: Im Blindpanel vom September 2026 hatte Oriole mit 8% den niedrigsten Anteil an Hinweisen auf einen fremdsprachigen Akzent. Dies ist ein Ergebnis des Hörpanels, kein automatisierter Akzentwert. Keine einzelne Kennzahl erfasst das gesamte Hörerlebnis.
Quelle: Benchmark des Perso-Engine-Teams, korrigiert am 22. September 2026. Kartenwerte: interne Videos, 16 englische und 13 koreanische Synchronisationspaare. Kleine Mittelwertunterschiede belegen keinen verlässlichen Vorteil. Prüfen Sie den Kreditverbrauch bei der Nutzung des Produkts.
Bedeutet Premium den höchsten Wert in jeder Metrik?
Nein. Nightingale ist unser Premium-Engine-Angebot. Unterschiedliche Modelle führen bei unterschiedlichen Messungen. Stimmidentität, Ausdruck, Übersetzung und Timing sollten getrennt betrachtet werden.
Warum Messung und Anhören trennen?
Automatische Metriken untersuchen bestimmte Signale. Sie erfassen Sprachfluss, emotionale Nuancen und die Eignung einer Darbietung für eine Szene nicht vollständig. Anhören bleibt unverzichtbar.
Repräsentieren die Benchmark-Sprachen alle unterstützten Sprachen?
Nein. Die FLEURS-Ergebnisse umfassen vier Zielsprachen, der interne Videodatensatz Englisch und Koreanisch. Sie dürfen nicht auf alle Sprachen oder Inhaltstypen verallgemeinert werden.
Entdecken Sie Perso Dubbing und wählen Sie das passende Modell für Ihr nächstes Projekt.
Perso Dubbing entdecken →