Produktleitfaden

Zwei Stimmen in einer Aufnahme trennen

Jump to section

Jump to section

Zusammenfassen mit

Zusammenfassen mit

Teilen

Teilen

Teilen

AI Video-Übersetzer, Lokalisierung und Synchronisationswerkzeug

Probieren Sie es kostenlos aus

Nutzen Sie zum Trennen zweier Stimmen die ursprünglichen Sprecherspuren, falls sie vorhanden sind. Andernfalls können Sie eine Trennung nach Sprechern ausprobieren. Prüfen Sie vor der Bearbeitung beide Ausgaben.

Ein Podcast-Gast ist zu leise. Ein Interviewer unterbricht eine Antwort. Sie möchten nur die Worte einer Person für einen kurzen Clip nutzen, doch beide Stimmen sind in einer Datei gemischt. Der nächste Schritt hängt davon ab, ob Sie das Aufnahmeprojekt, einzelne Mikrofonspuren oder nur die exportierte Audio- oder Videodatei haben.

Dieser Leitfaden hilft bei der Methodenwahl, der Prüfung getrennter Stimmen und ihrer Verwendung im Schnitt. Geht es um Musik hinter einem Gespräch, lesen Sie zunächst den Leitfaden zum Entfernen von Hintergrundmusik.

01. Die passende Methode auswählen

Vorhandenes Material

Einstieg

Wichtigste Grenze

Originale Mikrofon- oder Aufnahmespuren

Die Spur der gewünschten Person einzeln abhören und exportieren

Das Mikrofon kann auch die andere Stimme aufgenommen haben.

Gemischte Aufnahme mit abwechselnden Wortbeiträgen

Unerwünschte Abschnitte auf der Zeitleiste schneiden oder stummschalten

Gleichzeitig sprechende Stimmen werden so nicht getrennt.

Gemischte Aufnahme mit überlappender Sprache

Sprechertrennung an einem kurzen Ausschnitt testen

Auf fehlende Wörter und die verbleibende andere Stimme achten.

Entscheidungshilfe für Originalspuren, Zeitleistenbearbeitung oder Sprechertrennung.

Diagramm zur Methodenwahl, kein Produkt-Screenshot und kein Messergebnis.

Fall 1: Die Originalspuren sind verfügbar

Öffnen Sie das Aufnahmeprojekt und hören Sie die Mikrofonspur der gewünschten Person solo ab. Prüfen Sie, ob die andere Stimme durch Übersprechen hörbar bleibt, und exportieren Sie die nutzbare Spur. So müssen Sie Stimmen nicht aus einer fertigen Mischung rekonstruieren.

Eine Stereodatei hat zwei Kanäle, aber nicht unbedingt einen pro Person. Hören Sie links und rechts einzeln ab, bevor Sie sie als isolierte Sprecher behandeln.

Fall 2: Die Personen sprechen abwechselnd

Für einzelne Passagen genügt möglicherweise der Schnitt auf der Zeitleiste. Behalten Sie die gewünschten Beiträge und senken oder deaktivieren Sie die anderen. Lassen Sie Wortanfänge und Wortenden stehen und prüfen Sie jeden Schnitt auf abrupte Änderungen des Raumklangs.

Entfernen Sie etwa für einen reinen Gast-Clip die Frage nur, wenn die Antwort allein verständlich bleibt. Bewahren Sie den Kontext, wenn sich die Bedeutung sonst verändert.

Fall 3: Beide Stimmen überlagern sich

Wer den gemeinsamen Zeitraum stummschaltet, entfernt beide Stimmen. Testen Sie stattdessen einen kurzen Ausschnitt mit Sprechertrennung und vergleichen Sie jede Ausgabe an derselben Stelle mit dem Original.

Fehlt eine wichtige Aussage, nutzen Sie eine andere Aufnahme, fragen Sie nach der Original-Mikrofonspur oder wählen Sie eine Passage ohne Unterbrechung. Zwei ausgegebene Spuren bedeuten nicht, dass alle Wörter wiederhergestellt wurden.

02. Sprecherkennzeichnungen sind keine getrennten Audiospuren

Die Sprecherdiarisierung erkennt im Transkript, wer wann gesprochen hat. Die Google-Cloud-Dokumentation zur Diarisierung beschreibt beispielsweise Sprecherkennzeichnungen für erkannte Wörter. Daraus entsteht allein noch keine herunterladbare Datei mit nur einer Stimme.

Die Audio-Sprechertrennung soll solche Einzelspuren erzeugen. Prüfen Sie deshalb die tatsächliche Ausgabe eines Werkzeugs. Ein mit Speaker 1 und Speaker 2 gekennzeichnetes Transkript erleichtert die Textbearbeitung, obwohl die Tonaufnahme weiterhin gemischt sein kann.

Auch eine Gesang-/Stimmenspur ist etwas anderes: Sie kann beide Personen mit reduziertem Hintergrund enthalten. Mehr dazu unter Musik-Stimmentfernung und Video-Audiotrennung im Vergleich.

03. Einzelne Sprecherspuren in Perso Dubbing prüfen

1. Einen repräsentativen Ausschnitt wählen

Nehmen Sie einen klaren Satz jeder Person und, falls vorhanden, eine Unterbrechung auf. Bewahren Sie die Originaldatei zum Vergleich auf. Ein einfacher Einleitungssatz zeigt nicht, ob die schwierigste Passage nutzbar ist.

2. Die Datei hochladen

Öffnen Sie Perso Dubbing Audio Separation und verwenden Sie den Upload-Bereich. Prüfen Sie vor der Verarbeitung die angezeigten Dateianforderungen und Testbedingungen.

3. Die benötigte Ausgabe finden

Prüfen Sie nach der Verarbeitung die Spuren. Für die Stimme einer Person benötigen Sie eine Einzelspur. „All Speakers (Vocals)“ enthält die gemeinsamen Stimmen, nicht nur eine Person.

Hören Sie nach, wer welcher nummerierten Spur entspricht. Speaker 1 muss nicht der Moderator sein, und eine erkannte Spur ist nicht automatisch veröffentlichungsreif.

4. Die schwierige Passage vergleichen

Spielen Sie Original und Einzelspuren rund um eine Unterbrechung ab. Prüfen Sie auch einen ruhigen Satz und ein Wortende. Entscheiden Sie anhand der folgenden Checkliste, ob das Ergebnis zum Schnitt passt.

5. Exportieren und im Videoeditor weiterarbeiten

Das Exportmenü führt WAV-Dateien der Sprecher auf. Bei unserer Prüfung am 29. September zeigte der Download-Hinweis an, dass Spurdownloads mit dem Starter-Tarif freigeschaltet werden. Eine Registrierung allein bedeutet keinen kostenlosen Download. Im angemeldeten Arbeitsbereich kombiniert Audio Export die ausgewählten Spuren zu einer Datei. Deaktivieren Sie für einen einzelnen Sprecher die übrigen Spuren und prüfen Sie, ob Selected nur ihn anzeigt. Importieren Sie die Datei in den Editor, richten Sie sie am Original aus und schalten Sie den ursprünglichen Mischton stumm, damit die andere Stimme nicht wieder hinzukommt.

Prüfen Sie vor dem Videoexport die Synchronität am Anfang und später im Clip. Audiotrennung und Videoexport sind separate Schritte.

04. Worauf Sie vor der Verwendung hören sollten

Prüfung

Auffälligkeiten

Vorgehen

Benötigte Wörter

Fehlende Silben, Konsonanten oder veränderte Bedeutung

Dieselbe Aussage mit dem Original vergleichen. Wichtige fehlende Wörter nicht akzeptieren.

Andere Person

Eine zweite Stimme unter der ausgewählten Stimme

Anderen Schnitt oder originale Einzelaufnahme erwägen.

Unterbrechungen

Leise oder verzerrte Stimme bei gleichzeitiger Sprache

Überlappungen getrennt von klaren Wortbeiträgen prüfen.

Stimmklang

Metallischer Klang, abrupte Änderungen, ungleichmäßige Lautstärke

Mit Kopfhörern und einem Gerät des Publikums abhören.

Timing

Sprache vor oder nach der sichtbaren Mundbewegung

Ausrichtung und Schnittstellen prüfen.

Eine saubere Passage bestätigt nicht die gesamte Aufnahme. In einem kurzen Interview kann eine beschädigte Antwort wichtiger sein als mehrere klare Minuten.

05. Eine Grenze bei überlappender Sprache

In einem internen Test verarbeiteten wir eine etwa 19 Sekunden lange Aufnahme aus zwei synthetischen Stimmen. Die zweite setzte bei 6.5 Sekunden ein. Der angemeldete Arbeitsbereich lieferte zwei Sprecheroptionen, ein gekennzeichnetes Transkript und zwei herunterladbare WAV-Dateien von ungefähr der Originallänge.

Die Ausgabe Speaker 2 enthielt jedoch zwischen 6.5 und 10 Sekunden digitale Stille. Zwei exportierte Dateien belegen daher keine vollständige Wiederherstellung überlappender Stimmen. Eine Hörprüfung und die Zuordnung von Stimme zu Spur sind noch nicht abgeschlossen. Dies ist eine Signalbeobachtung an einem einzigen synthetischen Beispiel, kein Benchmark realer Interviews und keine Demonstration erfolgreicher Trennung.

Vergleichen Sie jede benötigte Aussage mit dem Original, besonders bei Unterbrechungen. Die volle Dateidauer kann erhalten bleiben, obwohl darin Sprache fehlt.

06. Wenn die Stimmen weiterhin überlagert sind

Bewerten Sie die Trennung an Ihrer eigenen Datei. Fehlen Wörter oder stört die andere Stimme, erwägen Sie einen anderen Ausschnitt, originale Mikrofonaufnahmen oder eine Neuaufnahme. Stellen Sie beschädigte Aussagen nicht als genaue Wiedergabe des Gesagten dar.

Prüfen Sie bei Transkription oder Synchronisation neben dem Klang auch die Sprecherzuordnung. Eine isolierte Spur bestätigt nicht die Richtigkeit von Transkript oder Übersetzung. Unser Leitfaden zur Transkription mehrerer Sprecher behandelt Kennzeichnungen und Skriptprüfung.

Ist das Ausgangsmaterial nutzbar, können Sie mit der Videosynchronisation fortfahren. Bewerten Sie Audiotrennung und übersetztes Skript separat.

07. Häufige Fragen

F. Lassen sich zwei gleichzeitig sprechende Stimmen trennen?
A. Sie können Sprechertrennung an der Mischung ausprobieren. Prüfen Sie die überlappende Passage jeder Ausgabe. Zwei Kennzeichnungen belegen nicht, dass beide Stimmen sauber erhalten sind. Bewahren Sie das Original zum Wort- und Klangvergleich auf.

F. Isoliert ein Vocal Remover eine Person aus einem Interview?
A. Prüfen Sie, was das Werkzeug mit „Vocals“ meint. Eine Ausgabe, die Stimme von Musik trennt, kann beide Personen enthalten. Suchen Sie Einzelspuren und hören Sie jede ab. Transkriptkennzeichnungen sind keine getrennten Audiospuren.

F. Kann ich das Ergebnis als Video herunterladen?
A. Die hier beschriebenen Downloads sind WAV-Audiodateien. Importieren Sie für ein fertiges Video den Ton in Ihren Editor, richten Sie ihn am Bild aus und schalten Sie die Originalmischung stumm. Bei der Prüfung am 29. September nannte der Hinweis den Starter-Tarif für Spurdownloads.

Testen Sie Ihre Aufnahme in Audio Separation. Vergleichen Sie zuerst die schwierige Passage, bevor Sie den vollständigen Schnitt beginnen.

Nutzen Sie zum Trennen zweier Stimmen die ursprünglichen Sprecherspuren, falls sie vorhanden sind. Andernfalls können Sie eine Trennung nach Sprechern ausprobieren. Prüfen Sie vor der Bearbeitung beide Ausgaben.

Ein Podcast-Gast ist zu leise. Ein Interviewer unterbricht eine Antwort. Sie möchten nur die Worte einer Person für einen kurzen Clip nutzen, doch beide Stimmen sind in einer Datei gemischt. Der nächste Schritt hängt davon ab, ob Sie das Aufnahmeprojekt, einzelne Mikrofonspuren oder nur die exportierte Audio- oder Videodatei haben.

Dieser Leitfaden hilft bei der Methodenwahl, der Prüfung getrennter Stimmen und ihrer Verwendung im Schnitt. Geht es um Musik hinter einem Gespräch, lesen Sie zunächst den Leitfaden zum Entfernen von Hintergrundmusik.

01. Die passende Methode auswählen

Vorhandenes Material

Einstieg

Wichtigste Grenze

Originale Mikrofon- oder Aufnahmespuren

Die Spur der gewünschten Person einzeln abhören und exportieren

Das Mikrofon kann auch die andere Stimme aufgenommen haben.

Gemischte Aufnahme mit abwechselnden Wortbeiträgen

Unerwünschte Abschnitte auf der Zeitleiste schneiden oder stummschalten

Gleichzeitig sprechende Stimmen werden so nicht getrennt.

Gemischte Aufnahme mit überlappender Sprache

Sprechertrennung an einem kurzen Ausschnitt testen

Auf fehlende Wörter und die verbleibende andere Stimme achten.

Entscheidungshilfe für Originalspuren, Zeitleistenbearbeitung oder Sprechertrennung.

Diagramm zur Methodenwahl, kein Produkt-Screenshot und kein Messergebnis.

Fall 1: Die Originalspuren sind verfügbar

Öffnen Sie das Aufnahmeprojekt und hören Sie die Mikrofonspur der gewünschten Person solo ab. Prüfen Sie, ob die andere Stimme durch Übersprechen hörbar bleibt, und exportieren Sie die nutzbare Spur. So müssen Sie Stimmen nicht aus einer fertigen Mischung rekonstruieren.

Eine Stereodatei hat zwei Kanäle, aber nicht unbedingt einen pro Person. Hören Sie links und rechts einzeln ab, bevor Sie sie als isolierte Sprecher behandeln.

Fall 2: Die Personen sprechen abwechselnd

Für einzelne Passagen genügt möglicherweise der Schnitt auf der Zeitleiste. Behalten Sie die gewünschten Beiträge und senken oder deaktivieren Sie die anderen. Lassen Sie Wortanfänge und Wortenden stehen und prüfen Sie jeden Schnitt auf abrupte Änderungen des Raumklangs.

Entfernen Sie etwa für einen reinen Gast-Clip die Frage nur, wenn die Antwort allein verständlich bleibt. Bewahren Sie den Kontext, wenn sich die Bedeutung sonst verändert.

Fall 3: Beide Stimmen überlagern sich

Wer den gemeinsamen Zeitraum stummschaltet, entfernt beide Stimmen. Testen Sie stattdessen einen kurzen Ausschnitt mit Sprechertrennung und vergleichen Sie jede Ausgabe an derselben Stelle mit dem Original.

Fehlt eine wichtige Aussage, nutzen Sie eine andere Aufnahme, fragen Sie nach der Original-Mikrofonspur oder wählen Sie eine Passage ohne Unterbrechung. Zwei ausgegebene Spuren bedeuten nicht, dass alle Wörter wiederhergestellt wurden.

02. Sprecherkennzeichnungen sind keine getrennten Audiospuren

Die Sprecherdiarisierung erkennt im Transkript, wer wann gesprochen hat. Die Google-Cloud-Dokumentation zur Diarisierung beschreibt beispielsweise Sprecherkennzeichnungen für erkannte Wörter. Daraus entsteht allein noch keine herunterladbare Datei mit nur einer Stimme.

Die Audio-Sprechertrennung soll solche Einzelspuren erzeugen. Prüfen Sie deshalb die tatsächliche Ausgabe eines Werkzeugs. Ein mit Speaker 1 und Speaker 2 gekennzeichnetes Transkript erleichtert die Textbearbeitung, obwohl die Tonaufnahme weiterhin gemischt sein kann.

Auch eine Gesang-/Stimmenspur ist etwas anderes: Sie kann beide Personen mit reduziertem Hintergrund enthalten. Mehr dazu unter Musik-Stimmentfernung und Video-Audiotrennung im Vergleich.

03. Einzelne Sprecherspuren in Perso Dubbing prüfen

1. Einen repräsentativen Ausschnitt wählen

Nehmen Sie einen klaren Satz jeder Person und, falls vorhanden, eine Unterbrechung auf. Bewahren Sie die Originaldatei zum Vergleich auf. Ein einfacher Einleitungssatz zeigt nicht, ob die schwierigste Passage nutzbar ist.

2. Die Datei hochladen

Öffnen Sie Perso Dubbing Audio Separation und verwenden Sie den Upload-Bereich. Prüfen Sie vor der Verarbeitung die angezeigten Dateianforderungen und Testbedingungen.

3. Die benötigte Ausgabe finden

Prüfen Sie nach der Verarbeitung die Spuren. Für die Stimme einer Person benötigen Sie eine Einzelspur. „All Speakers (Vocals)“ enthält die gemeinsamen Stimmen, nicht nur eine Person.

Hören Sie nach, wer welcher nummerierten Spur entspricht. Speaker 1 muss nicht der Moderator sein, und eine erkannte Spur ist nicht automatisch veröffentlichungsreif.

4. Die schwierige Passage vergleichen

Spielen Sie Original und Einzelspuren rund um eine Unterbrechung ab. Prüfen Sie auch einen ruhigen Satz und ein Wortende. Entscheiden Sie anhand der folgenden Checkliste, ob das Ergebnis zum Schnitt passt.

5. Exportieren und im Videoeditor weiterarbeiten

Das Exportmenü führt WAV-Dateien der Sprecher auf. Bei unserer Prüfung am 29. September zeigte der Download-Hinweis an, dass Spurdownloads mit dem Starter-Tarif freigeschaltet werden. Eine Registrierung allein bedeutet keinen kostenlosen Download. Im angemeldeten Arbeitsbereich kombiniert Audio Export die ausgewählten Spuren zu einer Datei. Deaktivieren Sie für einen einzelnen Sprecher die übrigen Spuren und prüfen Sie, ob Selected nur ihn anzeigt. Importieren Sie die Datei in den Editor, richten Sie sie am Original aus und schalten Sie den ursprünglichen Mischton stumm, damit die andere Stimme nicht wieder hinzukommt.

Prüfen Sie vor dem Videoexport die Synchronität am Anfang und später im Clip. Audiotrennung und Videoexport sind separate Schritte.

04. Worauf Sie vor der Verwendung hören sollten

Prüfung

Auffälligkeiten

Vorgehen

Benötigte Wörter

Fehlende Silben, Konsonanten oder veränderte Bedeutung

Dieselbe Aussage mit dem Original vergleichen. Wichtige fehlende Wörter nicht akzeptieren.

Andere Person

Eine zweite Stimme unter der ausgewählten Stimme

Anderen Schnitt oder originale Einzelaufnahme erwägen.

Unterbrechungen

Leise oder verzerrte Stimme bei gleichzeitiger Sprache

Überlappungen getrennt von klaren Wortbeiträgen prüfen.

Stimmklang

Metallischer Klang, abrupte Änderungen, ungleichmäßige Lautstärke

Mit Kopfhörern und einem Gerät des Publikums abhören.

Timing

Sprache vor oder nach der sichtbaren Mundbewegung

Ausrichtung und Schnittstellen prüfen.

Eine saubere Passage bestätigt nicht die gesamte Aufnahme. In einem kurzen Interview kann eine beschädigte Antwort wichtiger sein als mehrere klare Minuten.

05. Eine Grenze bei überlappender Sprache

In einem internen Test verarbeiteten wir eine etwa 19 Sekunden lange Aufnahme aus zwei synthetischen Stimmen. Die zweite setzte bei 6.5 Sekunden ein. Der angemeldete Arbeitsbereich lieferte zwei Sprecheroptionen, ein gekennzeichnetes Transkript und zwei herunterladbare WAV-Dateien von ungefähr der Originallänge.

Die Ausgabe Speaker 2 enthielt jedoch zwischen 6.5 und 10 Sekunden digitale Stille. Zwei exportierte Dateien belegen daher keine vollständige Wiederherstellung überlappender Stimmen. Eine Hörprüfung und die Zuordnung von Stimme zu Spur sind noch nicht abgeschlossen. Dies ist eine Signalbeobachtung an einem einzigen synthetischen Beispiel, kein Benchmark realer Interviews und keine Demonstration erfolgreicher Trennung.

Vergleichen Sie jede benötigte Aussage mit dem Original, besonders bei Unterbrechungen. Die volle Dateidauer kann erhalten bleiben, obwohl darin Sprache fehlt.

06. Wenn die Stimmen weiterhin überlagert sind

Bewerten Sie die Trennung an Ihrer eigenen Datei. Fehlen Wörter oder stört die andere Stimme, erwägen Sie einen anderen Ausschnitt, originale Mikrofonaufnahmen oder eine Neuaufnahme. Stellen Sie beschädigte Aussagen nicht als genaue Wiedergabe des Gesagten dar.

Prüfen Sie bei Transkription oder Synchronisation neben dem Klang auch die Sprecherzuordnung. Eine isolierte Spur bestätigt nicht die Richtigkeit von Transkript oder Übersetzung. Unser Leitfaden zur Transkription mehrerer Sprecher behandelt Kennzeichnungen und Skriptprüfung.

Ist das Ausgangsmaterial nutzbar, können Sie mit der Videosynchronisation fortfahren. Bewerten Sie Audiotrennung und übersetztes Skript separat.

07. Häufige Fragen

F. Lassen sich zwei gleichzeitig sprechende Stimmen trennen?
A. Sie können Sprechertrennung an der Mischung ausprobieren. Prüfen Sie die überlappende Passage jeder Ausgabe. Zwei Kennzeichnungen belegen nicht, dass beide Stimmen sauber erhalten sind. Bewahren Sie das Original zum Wort- und Klangvergleich auf.

F. Isoliert ein Vocal Remover eine Person aus einem Interview?
A. Prüfen Sie, was das Werkzeug mit „Vocals“ meint. Eine Ausgabe, die Stimme von Musik trennt, kann beide Personen enthalten. Suchen Sie Einzelspuren und hören Sie jede ab. Transkriptkennzeichnungen sind keine getrennten Audiospuren.

F. Kann ich das Ergebnis als Video herunterladen?
A. Die hier beschriebenen Downloads sind WAV-Audiodateien. Importieren Sie für ein fertiges Video den Ton in Ihren Editor, richten Sie ihn am Bild aus und schalten Sie die Originalmischung stumm. Bei der Prüfung am 29. September nannte der Hinweis den Starter-Tarif für Spurdownloads.

Testen Sie Ihre Aufnahme in Audio Separation. Vergleichen Sie zuerst die schwierige Passage, bevor Sie den vollständigen Schnitt beginnen.

Nutzen Sie zum Trennen zweier Stimmen die ursprünglichen Sprecherspuren, falls sie vorhanden sind. Andernfalls können Sie eine Trennung nach Sprechern ausprobieren. Prüfen Sie vor der Bearbeitung beide Ausgaben.

Ein Podcast-Gast ist zu leise. Ein Interviewer unterbricht eine Antwort. Sie möchten nur die Worte einer Person für einen kurzen Clip nutzen, doch beide Stimmen sind in einer Datei gemischt. Der nächste Schritt hängt davon ab, ob Sie das Aufnahmeprojekt, einzelne Mikrofonspuren oder nur die exportierte Audio- oder Videodatei haben.

Dieser Leitfaden hilft bei der Methodenwahl, der Prüfung getrennter Stimmen und ihrer Verwendung im Schnitt. Geht es um Musik hinter einem Gespräch, lesen Sie zunächst den Leitfaden zum Entfernen von Hintergrundmusik.

01. Die passende Methode auswählen

Vorhandenes Material

Einstieg

Wichtigste Grenze

Originale Mikrofon- oder Aufnahmespuren

Die Spur der gewünschten Person einzeln abhören und exportieren

Das Mikrofon kann auch die andere Stimme aufgenommen haben.

Gemischte Aufnahme mit abwechselnden Wortbeiträgen

Unerwünschte Abschnitte auf der Zeitleiste schneiden oder stummschalten

Gleichzeitig sprechende Stimmen werden so nicht getrennt.

Gemischte Aufnahme mit überlappender Sprache

Sprechertrennung an einem kurzen Ausschnitt testen

Auf fehlende Wörter und die verbleibende andere Stimme achten.

Entscheidungshilfe für Originalspuren, Zeitleistenbearbeitung oder Sprechertrennung.

Diagramm zur Methodenwahl, kein Produkt-Screenshot und kein Messergebnis.

Fall 1: Die Originalspuren sind verfügbar

Öffnen Sie das Aufnahmeprojekt und hören Sie die Mikrofonspur der gewünschten Person solo ab. Prüfen Sie, ob die andere Stimme durch Übersprechen hörbar bleibt, und exportieren Sie die nutzbare Spur. So müssen Sie Stimmen nicht aus einer fertigen Mischung rekonstruieren.

Eine Stereodatei hat zwei Kanäle, aber nicht unbedingt einen pro Person. Hören Sie links und rechts einzeln ab, bevor Sie sie als isolierte Sprecher behandeln.

Fall 2: Die Personen sprechen abwechselnd

Für einzelne Passagen genügt möglicherweise der Schnitt auf der Zeitleiste. Behalten Sie die gewünschten Beiträge und senken oder deaktivieren Sie die anderen. Lassen Sie Wortanfänge und Wortenden stehen und prüfen Sie jeden Schnitt auf abrupte Änderungen des Raumklangs.

Entfernen Sie etwa für einen reinen Gast-Clip die Frage nur, wenn die Antwort allein verständlich bleibt. Bewahren Sie den Kontext, wenn sich die Bedeutung sonst verändert.

Fall 3: Beide Stimmen überlagern sich

Wer den gemeinsamen Zeitraum stummschaltet, entfernt beide Stimmen. Testen Sie stattdessen einen kurzen Ausschnitt mit Sprechertrennung und vergleichen Sie jede Ausgabe an derselben Stelle mit dem Original.

Fehlt eine wichtige Aussage, nutzen Sie eine andere Aufnahme, fragen Sie nach der Original-Mikrofonspur oder wählen Sie eine Passage ohne Unterbrechung. Zwei ausgegebene Spuren bedeuten nicht, dass alle Wörter wiederhergestellt wurden.

02. Sprecherkennzeichnungen sind keine getrennten Audiospuren

Die Sprecherdiarisierung erkennt im Transkript, wer wann gesprochen hat. Die Google-Cloud-Dokumentation zur Diarisierung beschreibt beispielsweise Sprecherkennzeichnungen für erkannte Wörter. Daraus entsteht allein noch keine herunterladbare Datei mit nur einer Stimme.

Die Audio-Sprechertrennung soll solche Einzelspuren erzeugen. Prüfen Sie deshalb die tatsächliche Ausgabe eines Werkzeugs. Ein mit Speaker 1 und Speaker 2 gekennzeichnetes Transkript erleichtert die Textbearbeitung, obwohl die Tonaufnahme weiterhin gemischt sein kann.

Auch eine Gesang-/Stimmenspur ist etwas anderes: Sie kann beide Personen mit reduziertem Hintergrund enthalten. Mehr dazu unter Musik-Stimmentfernung und Video-Audiotrennung im Vergleich.

03. Einzelne Sprecherspuren in Perso Dubbing prüfen

1. Einen repräsentativen Ausschnitt wählen

Nehmen Sie einen klaren Satz jeder Person und, falls vorhanden, eine Unterbrechung auf. Bewahren Sie die Originaldatei zum Vergleich auf. Ein einfacher Einleitungssatz zeigt nicht, ob die schwierigste Passage nutzbar ist.

2. Die Datei hochladen

Öffnen Sie Perso Dubbing Audio Separation und verwenden Sie den Upload-Bereich. Prüfen Sie vor der Verarbeitung die angezeigten Dateianforderungen und Testbedingungen.

3. Die benötigte Ausgabe finden

Prüfen Sie nach der Verarbeitung die Spuren. Für die Stimme einer Person benötigen Sie eine Einzelspur. „All Speakers (Vocals)“ enthält die gemeinsamen Stimmen, nicht nur eine Person.

Hören Sie nach, wer welcher nummerierten Spur entspricht. Speaker 1 muss nicht der Moderator sein, und eine erkannte Spur ist nicht automatisch veröffentlichungsreif.

4. Die schwierige Passage vergleichen

Spielen Sie Original und Einzelspuren rund um eine Unterbrechung ab. Prüfen Sie auch einen ruhigen Satz und ein Wortende. Entscheiden Sie anhand der folgenden Checkliste, ob das Ergebnis zum Schnitt passt.

5. Exportieren und im Videoeditor weiterarbeiten

Das Exportmenü führt WAV-Dateien der Sprecher auf. Bei unserer Prüfung am 29. September zeigte der Download-Hinweis an, dass Spurdownloads mit dem Starter-Tarif freigeschaltet werden. Eine Registrierung allein bedeutet keinen kostenlosen Download. Im angemeldeten Arbeitsbereich kombiniert Audio Export die ausgewählten Spuren zu einer Datei. Deaktivieren Sie für einen einzelnen Sprecher die übrigen Spuren und prüfen Sie, ob Selected nur ihn anzeigt. Importieren Sie die Datei in den Editor, richten Sie sie am Original aus und schalten Sie den ursprünglichen Mischton stumm, damit die andere Stimme nicht wieder hinzukommt.

Prüfen Sie vor dem Videoexport die Synchronität am Anfang und später im Clip. Audiotrennung und Videoexport sind separate Schritte.

04. Worauf Sie vor der Verwendung hören sollten

Prüfung

Auffälligkeiten

Vorgehen

Benötigte Wörter

Fehlende Silben, Konsonanten oder veränderte Bedeutung

Dieselbe Aussage mit dem Original vergleichen. Wichtige fehlende Wörter nicht akzeptieren.

Andere Person

Eine zweite Stimme unter der ausgewählten Stimme

Anderen Schnitt oder originale Einzelaufnahme erwägen.

Unterbrechungen

Leise oder verzerrte Stimme bei gleichzeitiger Sprache

Überlappungen getrennt von klaren Wortbeiträgen prüfen.

Stimmklang

Metallischer Klang, abrupte Änderungen, ungleichmäßige Lautstärke

Mit Kopfhörern und einem Gerät des Publikums abhören.

Timing

Sprache vor oder nach der sichtbaren Mundbewegung

Ausrichtung und Schnittstellen prüfen.

Eine saubere Passage bestätigt nicht die gesamte Aufnahme. In einem kurzen Interview kann eine beschädigte Antwort wichtiger sein als mehrere klare Minuten.

05. Eine Grenze bei überlappender Sprache

In einem internen Test verarbeiteten wir eine etwa 19 Sekunden lange Aufnahme aus zwei synthetischen Stimmen. Die zweite setzte bei 6.5 Sekunden ein. Der angemeldete Arbeitsbereich lieferte zwei Sprecheroptionen, ein gekennzeichnetes Transkript und zwei herunterladbare WAV-Dateien von ungefähr der Originallänge.

Die Ausgabe Speaker 2 enthielt jedoch zwischen 6.5 und 10 Sekunden digitale Stille. Zwei exportierte Dateien belegen daher keine vollständige Wiederherstellung überlappender Stimmen. Eine Hörprüfung und die Zuordnung von Stimme zu Spur sind noch nicht abgeschlossen. Dies ist eine Signalbeobachtung an einem einzigen synthetischen Beispiel, kein Benchmark realer Interviews und keine Demonstration erfolgreicher Trennung.

Vergleichen Sie jede benötigte Aussage mit dem Original, besonders bei Unterbrechungen. Die volle Dateidauer kann erhalten bleiben, obwohl darin Sprache fehlt.

06. Wenn die Stimmen weiterhin überlagert sind

Bewerten Sie die Trennung an Ihrer eigenen Datei. Fehlen Wörter oder stört die andere Stimme, erwägen Sie einen anderen Ausschnitt, originale Mikrofonaufnahmen oder eine Neuaufnahme. Stellen Sie beschädigte Aussagen nicht als genaue Wiedergabe des Gesagten dar.

Prüfen Sie bei Transkription oder Synchronisation neben dem Klang auch die Sprecherzuordnung. Eine isolierte Spur bestätigt nicht die Richtigkeit von Transkript oder Übersetzung. Unser Leitfaden zur Transkription mehrerer Sprecher behandelt Kennzeichnungen und Skriptprüfung.

Ist das Ausgangsmaterial nutzbar, können Sie mit der Videosynchronisation fortfahren. Bewerten Sie Audiotrennung und übersetztes Skript separat.

07. Häufige Fragen

F. Lassen sich zwei gleichzeitig sprechende Stimmen trennen?
A. Sie können Sprechertrennung an der Mischung ausprobieren. Prüfen Sie die überlappende Passage jeder Ausgabe. Zwei Kennzeichnungen belegen nicht, dass beide Stimmen sauber erhalten sind. Bewahren Sie das Original zum Wort- und Klangvergleich auf.

F. Isoliert ein Vocal Remover eine Person aus einem Interview?
A. Prüfen Sie, was das Werkzeug mit „Vocals“ meint. Eine Ausgabe, die Stimme von Musik trennt, kann beide Personen enthalten. Suchen Sie Einzelspuren und hören Sie jede ab. Transkriptkennzeichnungen sind keine getrennten Audiospuren.

F. Kann ich das Ergebnis als Video herunterladen?
A. Die hier beschriebenen Downloads sind WAV-Audiodateien. Importieren Sie für ein fertiges Video den Ton in Ihren Editor, richten Sie ihn am Bild aus und schalten Sie die Originalmischung stumm. Bei der Prüfung am 29. September nannte der Hinweis den Starter-Tarif für Spurdownloads.

Testen Sie Ihre Aufnahme in Audio Separation. Vergleichen Sie zuerst die schwierige Passage, bevor Sie den vollständigen Schnitt beginnen.

Weiterlesen

Alle durchsuchen

Die besten kostenlosen KI-Video-Übersetzer in 2026 (8 Tools im Test)
Produktleitfaden

Die besten kostenlosen KI-Video-Übersetzer in 2026 (8 Tools im Test)

Leiter Wachstum & Produktinhaber Untae Bae

Untae Bae

Leiter Wachstum & Produktverantwortlicher

Was ist KI-Lippensynchronisation? — Perso Dubbing Produkt-Guide
Produktleitfaden

Was ist KI-Lippensynchronisation? Funktionsweise, Tools & Anwendungen

Wachstums-Marketer Hyesun Shin

Hyesun Shin

Wachstumsmarketer

Dentalbean lokalisierte koreanische kieferorthopädische Schulungen für Zahnärzte weltweit mit Perso Dubbing und senkte die Synchronisationskosten um 95–99 %, während die Stimme des Dozenten erhalten blieb. Sehen Sie sich die vollständige Fallstudie an.
Kunden Geschichten

Globale medizinische Ausbildung mit KI-Dubbing

Business Development Hyeram Lee

Hyeram Lee

Geschäftsentwicklung