Perso Dubbing / Modelle

Unsere neue Premium-Engine für Synchronisation.

Unsere neue Premium-Engine für Synchronisation.

Nightingale

Nightingale

Nightingale

Nightingale ist eine Premium-KI-Synchronisationsengine für Inhalte, bei denen Emotionen zählen. Vergleichen Sie Modellstärken und Bewertungen anhand realer Videos, um das passende Modell für Ihre Inhalte zu wählen.

Nightingale ist eine Premium-KI-Synchronisationsengine für Inhalte, bei denen Emotionen zählen. Vergleichen Sie Modellstärken und Bewertungen anhand realer Videos, um das passende Modell für Ihre Inhalte zu wählen.

Das passende Modell
für Ihre Inhalte.

Das passende Modell
für Ihre Inhalte.

Beginnen Sie mit Ihrem Einsatz: emotionale Darbietungen, Inhalte für lokale Zielgruppen, Ihre eigene Stimme oder gleichmäßige Erzählungen. Alle Kartenwerte basieren auf demselben internen Videodatensatz.

Drama, Unterhaltung und emotionale Darbietungen

Nightingale

Für Kreative und Studios, die emotionale Höhen und Tiefen in Premiumqualität vermitteln möchten. Nightingale erzielt in beiden getesteten Sprachen den höchsten Mittelwert bei der Nachbildung des ursprünglichen Ausdrucks.

Interne Videos · Ausdrucksnachbildung: EN 0.45, KO 0.54. Gemessen wird die Stimmintensität, nicht die Gesamtqualität.

Vorlesungen, Unternehmensvideos und lokale Zielgruppen

Oriole

Ein für lokale Zielgruppen natürlich klingender Akzent, gestützt auf die Hörbewertung. Oriole eignet sich für Vorlesungen und Unternehmensvideos, die eine beständige Stimme von Satz zu Satz benötigen.

Interne Videos · Englische Stimmkonsistenz: 0.661, der höchste Mittelwert. Im Koreanischen führt Wren.

Eigene Stimme, Interviews und große Produktionsmengen

Finch

Für Kreative, die ihre eigene Stimme beim Synchronisieren von Interviews oder eines ganzen Kanals bewahren möchten. Finch erzielte die höchste mittlere Stimmähnlichkeit im Englischen und ist für Stimmerhalt und kostengünstige Produktion konzipiert.

Interne Videos · Englische Stimmähnlichkeit: 0.564. Im Fokus stehen Stimmerhalt und geringe Kosten. Prüfen Sie englische und spanische Akzente vor der Veröffentlichung.

Vorlesungen, Unternehmensnarration und gleichmäßiges Vorlesen

Wren

Für Lehrende und Unternehmen, die eine gleichmäßige Erzählstimme suchen. Wren eignet sich für Vorlesungsskripte, Unternehmensvorstellungen und vorgelesene Inhalte und erreicht die höchste mittlere koreanische Stimmkonsistenz im internen Videodatensatz.

Interne Videos · Koreanische Stimmkonsistenz: 0.713. Vorhergesagte englische Natürlichkeit: 3.64/5, ein automatisierter Wert und keine Hörbewertung.

Dodo ist das frühere Expressive-Modell und wird zur Einordnung im Benchmark mitgeführt. Verfügbarkeit und Nutzungsbedingungen der Modelle finden Sie im Produkt.

So bewerten wir Synchronisation

Stimmähnlichkeit.
Ausdruck. Konsistenz.

Stimmähnlichkeit.
Ausdruck. Konsistenz.

Synchronisationsqualität hat mehrere Dimensionen. Wir bewerten, wem die Stimme ähnelt, wie sie dem ursprünglichen Ausdruck folgt und wie konsistent sie durch eine Szene trägt. Auch Übersetzung, Spracherkennungsfehler und zeitliche Abstimmung werden untersucht.

01

Stimmidentität

Ähnelt die synchronisierte Stimme weiterhin der ursprünglichen Person?

Ähnlichkeit mit der ursprünglichen Stimme

02

Ausdruck

Folgt die Stimmintensität der ursprünglichen Darbietung?

Korrelation der stimmlichen Aktivierung · Tonhöhenanalyse

03

Konsistenz

Bleibt die erzeugte Stimme von Satz zu Satz einheitlich?

Stimmähnlichkeit aufeinanderfolgender Sätze

Engineering-Benchmark · 22. September 2026

Messwerte erkunden.

Wählen Sie Datensatz, Zielsprache und Kennzahl, um die Modelle zu vergleichen. Die Werte verwenden die jeweils angegebene Skala und die zugehörigen Bewertungsbedingungen.

Modell
00.250.50.751
Mittelwert
Wren0.341
Dodo0.353
Oriole0.323
Finch0.564
Nightingale0.414

Quelle: Benchmark des Perso-Engine-Teams, korrigiert am 22. September 2026. Hervorgehobene Zeilen haben den besten Mittelwert für die gewählte Kennzahl; Gleichstände werden gemeinsam markiert. Dies belegt weder statistische Signifikanz noch überlegene Gesamtqualität.

Ergebnis einordnen

Finch hat den höchsten Mittelwert in allen vier Zielsprachen der öffentlichen Vorlesedaten und in internen englischen Videos. Bei internen koreanischen Videos erreicht Nightingale 0.486 und Finch 0.483; die Ergebnisse liegen nahe beieinander.

Bewertungsbedingungen

Öffentliche Vorlesedaten: 13 Sprachpaare mit Koreanisch, Englisch, Portugiesisch und Chinesisch als Ausgangssprachen und Englisch, Spanisch, Portugiesisch und Koreanisch als Zielsprachen. Mittelwerte werden je Vorlesergruppe gebildet. Interne Videos: 29 Synchronisationspaare, 16 ins Englische und 13 ins Koreanische.

In FLEURS erhalten Wren, Dodo, Oriole und Finch Transkript und Zeitvorgaben und teilen eine festgelegte Übersetzung. Nightingale führt Spracherkennung und Übersetzung selbst durch. Die ersten vier werden anhand sauberer Einzelzeilen-Clips bewertet; Nightingales Ausgabe wird sprachsepariert und an den Zeitfenstern der ursprünglichen Sätze ausgerichtet. Bei internen Videos übersetzt jedes Modell selbst. Dort werden Spracherkennungsfehler bei allen Modellen auf vollständigen Spuren bewertet.

Öffentliche Vorlesedaten stehen unter CC BY 4.0. Die Ergebnisse decken ausgewählte Sprachen und Inhalte ab, nicht alle Produktionsszenarien. Es wird keine Gesamtrangliste der Modelle berechnet.

Testdaten und Bewertungsmethoden

Testdaten und Bewertungsmethoden

Die Kartenwerte stammen aus einem gemeinsamen internen Videodatensatz. Der Explorer enthält zusätzlich öffentliche Vorlesedaten. Die Hörbewertung liefert separate Belege zur Akzentqualität.

13

FLEURS-Sprachpaare

Öffentliche Daten vorgelesener Sprache. Ausgangssprachen: Koreanisch, Englisch, Portugiesisch und Chinesisch. Zielsprachen: Englisch, Spanisch, Portugiesisch und Koreanisch. 64 Sätze pro Ausgangssprache, nach Lesenden gruppiert. CC BY 4.0.

29

Interne Videopaare

Ein separater Satz kundentypischer Videos mit 16 Synchronisationspaaren ins Englische und 13 ins Koreanische. Bewertet Inhalte mit engeren Zeitvorgaben und vielfältigeren Audiobedingungen.

Was diese Ergebnisse aussagen

Bei FLEURS erhalten Wren, Dodo, Oriole und Finch Transkripte und Zeitvorgaben sowie eine gemeinsame Übersetzung. Nightingale führt Spracherkennung und Übersetzung selbst durch. Dies sind Ergebnisse vollständiger Prozesse unter dokumentierten Bedingungen, kein kontrollierter Vergleich von isoliertem TTS.

Hörbewertung: Im Blindpanel vom September 2026 hatte Oriole mit 8% den niedrigsten Anteil an Hinweisen auf einen fremdsprachigen Akzent. Dies ist ein Ergebnis des Hörpanels, kein automatisierter Akzentwert. Keine einzelne Kennzahl erfasst das gesamte Hörerlebnis.

Quelle: Benchmark des Perso-Engine-Teams, korrigiert am 22. September 2026. Kartenwerte: interne Videos, 16 englische und 13 koreanische Synchronisationspaare. Kleine Mittelwertunterschiede belegen keinen verlässlichen Vorteil. Prüfen Sie den Kreditverbrauch bei der Nutzung des Produkts.

Fragen zur Synchronisationsqualität

Fragen zur Synchronisationsqualität

Bedeutet Premium den höchsten Wert in jeder Metrik?

Nein. Nightingale ist unser Premium-Engine-Angebot. Unterschiedliche Modelle führen bei unterschiedlichen Messungen. Stimmidentität, Ausdruck, Übersetzung und Timing sollten getrennt betrachtet werden.

Warum Messung und Anhören trennen?

Automatische Metriken untersuchen bestimmte Signale. Sie erfassen Sprachfluss, emotionale Nuancen und die Eignung einer Darbietung für eine Szene nicht vollständig. Anhören bleibt unverzichtbar.

Repräsentieren die Benchmark-Sprachen alle unterstützten Sprachen?

Nein. Die FLEURS-Ergebnisse umfassen vier Zielsprachen, der interne Videodatensatz Englisch und Koreanisch. Sie dürfen nicht auf alle Sprachen oder Inhaltstypen verallgemeinert werden.

Modell auswählen.
Synchronisation starten.

Modell auswählen.
Synchronisation starten.

Entdecken Sie Perso Dubbing und wählen Sie das passende Modell für Ihr nächstes Projekt.

Perso Dubbing entdecken →