Zwei Stimmen in einer Aufnahme trennen
Zuletzt aktualisiert
Jump to section
Jump to section
Teilen
Teilen
Teilen

AI Video-Übersetzer, Lokalisierung und Synchronisationswerkzeug
Probieren Sie es kostenlos aus
Nutzen Sie zum Trennen zweier Stimmen die ursprünglichen Sprecherspuren, falls sie vorhanden sind. Andernfalls können Sie eine Trennung nach Sprechern ausprobieren. Prüfen Sie vor der Bearbeitung beide Ausgaben.
Ein Podcast-Gast ist zu leise. Ein Interviewer unterbricht eine Antwort. Sie möchten nur die Worte einer Person für einen kurzen Clip nutzen, doch beide Stimmen sind in einer Datei gemischt. Der nächste Schritt hängt davon ab, ob Sie das Aufnahmeprojekt, einzelne Mikrofonspuren oder nur die exportierte Audio- oder Videodatei haben.
Dieser Leitfaden hilft bei der Methodenwahl, der Prüfung getrennter Stimmen und ihrer Verwendung im Schnitt. Geht es um Musik hinter einem Gespräch, lesen Sie zunächst den Leitfaden zum Entfernen von Hintergrundmusik.
01. Die passende Methode auswählen
Vorhandenes Material | Einstieg | Wichtigste Grenze |
|---|---|---|
Originale Mikrofon- oder Aufnahmespuren | Die Spur der gewünschten Person einzeln abhören und exportieren | Das Mikrofon kann auch die andere Stimme aufgenommen haben. |
Gemischte Aufnahme mit abwechselnden Wortbeiträgen | Unerwünschte Abschnitte auf der Zeitleiste schneiden oder stummschalten | Gleichzeitig sprechende Stimmen werden so nicht getrennt. |
Gemischte Aufnahme mit überlappender Sprache | Sprechertrennung an einem kurzen Ausschnitt testen | Auf fehlende Wörter und die verbleibende andere Stimme achten. |

Diagramm zur Methodenwahl, kein Produkt-Screenshot und kein Messergebnis.
Fall 1: Die Originalspuren sind verfügbar
Öffnen Sie das Aufnahmeprojekt und hören Sie die Mikrofonspur der gewünschten Person solo ab. Prüfen Sie, ob die andere Stimme durch Übersprechen hörbar bleibt, und exportieren Sie die nutzbare Spur. So müssen Sie Stimmen nicht aus einer fertigen Mischung rekonstruieren.
Eine Stereodatei hat zwei Kanäle, aber nicht unbedingt einen pro Person. Hören Sie links und rechts einzeln ab, bevor Sie sie als isolierte Sprecher behandeln.
Fall 2: Die Personen sprechen abwechselnd
Für einzelne Passagen genügt möglicherweise der Schnitt auf der Zeitleiste. Behalten Sie die gewünschten Beiträge und senken oder deaktivieren Sie die anderen. Lassen Sie Wortanfänge und Wortenden stehen und prüfen Sie jeden Schnitt auf abrupte Änderungen des Raumklangs.
Entfernen Sie etwa für einen reinen Gast-Clip die Frage nur, wenn die Antwort allein verständlich bleibt. Bewahren Sie den Kontext, wenn sich die Bedeutung sonst verändert.
Fall 3: Beide Stimmen überlagern sich
Wer den gemeinsamen Zeitraum stummschaltet, entfernt beide Stimmen. Testen Sie stattdessen einen kurzen Ausschnitt mit Sprechertrennung und vergleichen Sie jede Ausgabe an derselben Stelle mit dem Original.
Fehlt eine wichtige Aussage, nutzen Sie eine andere Aufnahme, fragen Sie nach der Original-Mikrofonspur oder wählen Sie eine Passage ohne Unterbrechung. Zwei ausgegebene Spuren bedeuten nicht, dass alle Wörter wiederhergestellt wurden.
02. Sprecherkennzeichnungen sind keine getrennten Audiospuren
Die Sprecherdiarisierung erkennt im Transkript, wer wann gesprochen hat. Die Google-Cloud-Dokumentation zur Diarisierung beschreibt beispielsweise Sprecherkennzeichnungen für erkannte Wörter. Daraus entsteht allein noch keine herunterladbare Datei mit nur einer Stimme.
Die Audio-Sprechertrennung soll solche Einzelspuren erzeugen. Prüfen Sie deshalb die tatsächliche Ausgabe eines Werkzeugs. Ein mit Speaker 1 und Speaker 2 gekennzeichnetes Transkript erleichtert die Textbearbeitung, obwohl die Tonaufnahme weiterhin gemischt sein kann.
Auch eine Gesang-/Stimmenspur ist etwas anderes: Sie kann beide Personen mit reduziertem Hintergrund enthalten. Mehr dazu unter Musik-Stimmentfernung und Video-Audiotrennung im Vergleich.
03. Einzelne Sprecherspuren in Perso Dubbing prüfen
1. Einen repräsentativen Ausschnitt wählen
Nehmen Sie einen klaren Satz jeder Person und, falls vorhanden, eine Unterbrechung auf. Bewahren Sie die Originaldatei zum Vergleich auf. Ein einfacher Einleitungssatz zeigt nicht, ob die schwierigste Passage nutzbar ist.
2. Die Datei hochladen
Öffnen Sie Perso Dubbing Audio Separation und verwenden Sie den Upload-Bereich. Prüfen Sie vor der Verarbeitung die angezeigten Dateianforderungen und Testbedingungen.
3. Die benötigte Ausgabe finden
Prüfen Sie nach der Verarbeitung die Spuren. Für die Stimme einer Person benötigen Sie eine Einzelspur. „All Speakers (Vocals)“ enthält die gemeinsamen Stimmen, nicht nur eine Person.
Hören Sie nach, wer welcher nummerierten Spur entspricht. Speaker 1 muss nicht der Moderator sein, und eine erkannte Spur ist nicht automatisch veröffentlichungsreif.
4. Die schwierige Passage vergleichen
Spielen Sie Original und Einzelspuren rund um eine Unterbrechung ab. Prüfen Sie auch einen ruhigen Satz und ein Wortende. Entscheiden Sie anhand der folgenden Checkliste, ob das Ergebnis zum Schnitt passt.
5. Exportieren und im Videoeditor weiterarbeiten
Das Exportmenü führt WAV-Dateien der Sprecher auf. Bei unserer Prüfung am 29. September zeigte der Download-Hinweis an, dass Spurdownloads mit dem Starter-Tarif freigeschaltet werden. Eine Registrierung allein bedeutet keinen kostenlosen Download. Im angemeldeten Arbeitsbereich kombiniert Audio Export die ausgewählten Spuren zu einer Datei. Deaktivieren Sie für einen einzelnen Sprecher die übrigen Spuren und prüfen Sie, ob Selected nur ihn anzeigt. Importieren Sie die Datei in den Editor, richten Sie sie am Original aus und schalten Sie den ursprünglichen Mischton stumm, damit die andere Stimme nicht wieder hinzukommt.
Prüfen Sie vor dem Videoexport die Synchronität am Anfang und später im Clip. Audiotrennung und Videoexport sind separate Schritte.
04. Worauf Sie vor der Verwendung hören sollten
Prüfung | Auffälligkeiten | Vorgehen |
|---|---|---|
Benötigte Wörter | Fehlende Silben, Konsonanten oder veränderte Bedeutung | Dieselbe Aussage mit dem Original vergleichen. Wichtige fehlende Wörter nicht akzeptieren. |
Andere Person | Eine zweite Stimme unter der ausgewählten Stimme | Anderen Schnitt oder originale Einzelaufnahme erwägen. |
Unterbrechungen | Leise oder verzerrte Stimme bei gleichzeitiger Sprache | Überlappungen getrennt von klaren Wortbeiträgen prüfen. |
Stimmklang | Metallischer Klang, abrupte Änderungen, ungleichmäßige Lautstärke | Mit Kopfhörern und einem Gerät des Publikums abhören. |
Timing | Sprache vor oder nach der sichtbaren Mundbewegung | Ausrichtung und Schnittstellen prüfen. |
Eine saubere Passage bestätigt nicht die gesamte Aufnahme. In einem kurzen Interview kann eine beschädigte Antwort wichtiger sein als mehrere klare Minuten.
05. Eine Grenze bei überlappender Sprache
In einem internen Test verarbeiteten wir eine etwa 19 Sekunden lange Aufnahme aus zwei synthetischen Stimmen. Die zweite setzte bei 6.5 Sekunden ein. Der angemeldete Arbeitsbereich lieferte zwei Sprecheroptionen, ein gekennzeichnetes Transkript und zwei herunterladbare WAV-Dateien von ungefähr der Originallänge.
Die Ausgabe Speaker 2 enthielt jedoch zwischen 6.5 und 10 Sekunden digitale Stille. Zwei exportierte Dateien belegen daher keine vollständige Wiederherstellung überlappender Stimmen. Eine Hörprüfung und die Zuordnung von Stimme zu Spur sind noch nicht abgeschlossen. Dies ist eine Signalbeobachtung an einem einzigen synthetischen Beispiel, kein Benchmark realer Interviews und keine Demonstration erfolgreicher Trennung.
Vergleichen Sie jede benötigte Aussage mit dem Original, besonders bei Unterbrechungen. Die volle Dateidauer kann erhalten bleiben, obwohl darin Sprache fehlt.
06. Wenn die Stimmen weiterhin überlagert sind
Bewerten Sie die Trennung an Ihrer eigenen Datei. Fehlen Wörter oder stört die andere Stimme, erwägen Sie einen anderen Ausschnitt, originale Mikrofonaufnahmen oder eine Neuaufnahme. Stellen Sie beschädigte Aussagen nicht als genaue Wiedergabe des Gesagten dar.
Prüfen Sie bei Transkription oder Synchronisation neben dem Klang auch die Sprecherzuordnung. Eine isolierte Spur bestätigt nicht die Richtigkeit von Transkript oder Übersetzung. Unser Leitfaden zur Transkription mehrerer Sprecher behandelt Kennzeichnungen und Skriptprüfung.
Ist das Ausgangsmaterial nutzbar, können Sie mit der Videosynchronisation fortfahren. Bewerten Sie Audiotrennung und übersetztes Skript separat.
07. Häufige Fragen
F. Lassen sich zwei gleichzeitig sprechende Stimmen trennen?
A. Sie können Sprechertrennung an der Mischung ausprobieren. Prüfen Sie die überlappende Passage jeder Ausgabe. Zwei Kennzeichnungen belegen nicht, dass beide Stimmen sauber erhalten sind. Bewahren Sie das Original zum Wort- und Klangvergleich auf.
F. Isoliert ein Vocal Remover eine Person aus einem Interview?
A. Prüfen Sie, was das Werkzeug mit „Vocals“ meint. Eine Ausgabe, die Stimme von Musik trennt, kann beide Personen enthalten. Suchen Sie Einzelspuren und hören Sie jede ab. Transkriptkennzeichnungen sind keine getrennten Audiospuren.
F. Kann ich das Ergebnis als Video herunterladen?
A. Die hier beschriebenen Downloads sind WAV-Audiodateien. Importieren Sie für ein fertiges Video den Ton in Ihren Editor, richten Sie ihn am Bild aus und schalten Sie die Originalmischung stumm. Bei der Prüfung am 29. September nannte der Hinweis den Starter-Tarif für Spurdownloads.
Testen Sie Ihre Aufnahme in Audio Separation. Vergleichen Sie zuerst die schwierige Passage, bevor Sie den vollständigen Schnitt beginnen.
Nutzen Sie zum Trennen zweier Stimmen die ursprünglichen Sprecherspuren, falls sie vorhanden sind. Andernfalls können Sie eine Trennung nach Sprechern ausprobieren. Prüfen Sie vor der Bearbeitung beide Ausgaben.
Ein Podcast-Gast ist zu leise. Ein Interviewer unterbricht eine Antwort. Sie möchten nur die Worte einer Person für einen kurzen Clip nutzen, doch beide Stimmen sind in einer Datei gemischt. Der nächste Schritt hängt davon ab, ob Sie das Aufnahmeprojekt, einzelne Mikrofonspuren oder nur die exportierte Audio- oder Videodatei haben.
Dieser Leitfaden hilft bei der Methodenwahl, der Prüfung getrennter Stimmen und ihrer Verwendung im Schnitt. Geht es um Musik hinter einem Gespräch, lesen Sie zunächst den Leitfaden zum Entfernen von Hintergrundmusik.
01. Die passende Methode auswählen
Vorhandenes Material | Einstieg | Wichtigste Grenze |
|---|---|---|
Originale Mikrofon- oder Aufnahmespuren | Die Spur der gewünschten Person einzeln abhören und exportieren | Das Mikrofon kann auch die andere Stimme aufgenommen haben. |
Gemischte Aufnahme mit abwechselnden Wortbeiträgen | Unerwünschte Abschnitte auf der Zeitleiste schneiden oder stummschalten | Gleichzeitig sprechende Stimmen werden so nicht getrennt. |
Gemischte Aufnahme mit überlappender Sprache | Sprechertrennung an einem kurzen Ausschnitt testen | Auf fehlende Wörter und die verbleibende andere Stimme achten. |

Diagramm zur Methodenwahl, kein Produkt-Screenshot und kein Messergebnis.
Fall 1: Die Originalspuren sind verfügbar
Öffnen Sie das Aufnahmeprojekt und hören Sie die Mikrofonspur der gewünschten Person solo ab. Prüfen Sie, ob die andere Stimme durch Übersprechen hörbar bleibt, und exportieren Sie die nutzbare Spur. So müssen Sie Stimmen nicht aus einer fertigen Mischung rekonstruieren.
Eine Stereodatei hat zwei Kanäle, aber nicht unbedingt einen pro Person. Hören Sie links und rechts einzeln ab, bevor Sie sie als isolierte Sprecher behandeln.
Fall 2: Die Personen sprechen abwechselnd
Für einzelne Passagen genügt möglicherweise der Schnitt auf der Zeitleiste. Behalten Sie die gewünschten Beiträge und senken oder deaktivieren Sie die anderen. Lassen Sie Wortanfänge und Wortenden stehen und prüfen Sie jeden Schnitt auf abrupte Änderungen des Raumklangs.
Entfernen Sie etwa für einen reinen Gast-Clip die Frage nur, wenn die Antwort allein verständlich bleibt. Bewahren Sie den Kontext, wenn sich die Bedeutung sonst verändert.
Fall 3: Beide Stimmen überlagern sich
Wer den gemeinsamen Zeitraum stummschaltet, entfernt beide Stimmen. Testen Sie stattdessen einen kurzen Ausschnitt mit Sprechertrennung und vergleichen Sie jede Ausgabe an derselben Stelle mit dem Original.
Fehlt eine wichtige Aussage, nutzen Sie eine andere Aufnahme, fragen Sie nach der Original-Mikrofonspur oder wählen Sie eine Passage ohne Unterbrechung. Zwei ausgegebene Spuren bedeuten nicht, dass alle Wörter wiederhergestellt wurden.
02. Sprecherkennzeichnungen sind keine getrennten Audiospuren
Die Sprecherdiarisierung erkennt im Transkript, wer wann gesprochen hat. Die Google-Cloud-Dokumentation zur Diarisierung beschreibt beispielsweise Sprecherkennzeichnungen für erkannte Wörter. Daraus entsteht allein noch keine herunterladbare Datei mit nur einer Stimme.
Die Audio-Sprechertrennung soll solche Einzelspuren erzeugen. Prüfen Sie deshalb die tatsächliche Ausgabe eines Werkzeugs. Ein mit Speaker 1 und Speaker 2 gekennzeichnetes Transkript erleichtert die Textbearbeitung, obwohl die Tonaufnahme weiterhin gemischt sein kann.
Auch eine Gesang-/Stimmenspur ist etwas anderes: Sie kann beide Personen mit reduziertem Hintergrund enthalten. Mehr dazu unter Musik-Stimmentfernung und Video-Audiotrennung im Vergleich.
03. Einzelne Sprecherspuren in Perso Dubbing prüfen
1. Einen repräsentativen Ausschnitt wählen
Nehmen Sie einen klaren Satz jeder Person und, falls vorhanden, eine Unterbrechung auf. Bewahren Sie die Originaldatei zum Vergleich auf. Ein einfacher Einleitungssatz zeigt nicht, ob die schwierigste Passage nutzbar ist.
2. Die Datei hochladen
Öffnen Sie Perso Dubbing Audio Separation und verwenden Sie den Upload-Bereich. Prüfen Sie vor der Verarbeitung die angezeigten Dateianforderungen und Testbedingungen.
3. Die benötigte Ausgabe finden
Prüfen Sie nach der Verarbeitung die Spuren. Für die Stimme einer Person benötigen Sie eine Einzelspur. „All Speakers (Vocals)“ enthält die gemeinsamen Stimmen, nicht nur eine Person.
Hören Sie nach, wer welcher nummerierten Spur entspricht. Speaker 1 muss nicht der Moderator sein, und eine erkannte Spur ist nicht automatisch veröffentlichungsreif.
4. Die schwierige Passage vergleichen
Spielen Sie Original und Einzelspuren rund um eine Unterbrechung ab. Prüfen Sie auch einen ruhigen Satz und ein Wortende. Entscheiden Sie anhand der folgenden Checkliste, ob das Ergebnis zum Schnitt passt.
5. Exportieren und im Videoeditor weiterarbeiten
Das Exportmenü führt WAV-Dateien der Sprecher auf. Bei unserer Prüfung am 29. September zeigte der Download-Hinweis an, dass Spurdownloads mit dem Starter-Tarif freigeschaltet werden. Eine Registrierung allein bedeutet keinen kostenlosen Download. Im angemeldeten Arbeitsbereich kombiniert Audio Export die ausgewählten Spuren zu einer Datei. Deaktivieren Sie für einen einzelnen Sprecher die übrigen Spuren und prüfen Sie, ob Selected nur ihn anzeigt. Importieren Sie die Datei in den Editor, richten Sie sie am Original aus und schalten Sie den ursprünglichen Mischton stumm, damit die andere Stimme nicht wieder hinzukommt.
Prüfen Sie vor dem Videoexport die Synchronität am Anfang und später im Clip. Audiotrennung und Videoexport sind separate Schritte.
04. Worauf Sie vor der Verwendung hören sollten
Prüfung | Auffälligkeiten | Vorgehen |
|---|---|---|
Benötigte Wörter | Fehlende Silben, Konsonanten oder veränderte Bedeutung | Dieselbe Aussage mit dem Original vergleichen. Wichtige fehlende Wörter nicht akzeptieren. |
Andere Person | Eine zweite Stimme unter der ausgewählten Stimme | Anderen Schnitt oder originale Einzelaufnahme erwägen. |
Unterbrechungen | Leise oder verzerrte Stimme bei gleichzeitiger Sprache | Überlappungen getrennt von klaren Wortbeiträgen prüfen. |
Stimmklang | Metallischer Klang, abrupte Änderungen, ungleichmäßige Lautstärke | Mit Kopfhörern und einem Gerät des Publikums abhören. |
Timing | Sprache vor oder nach der sichtbaren Mundbewegung | Ausrichtung und Schnittstellen prüfen. |
Eine saubere Passage bestätigt nicht die gesamte Aufnahme. In einem kurzen Interview kann eine beschädigte Antwort wichtiger sein als mehrere klare Minuten.
05. Eine Grenze bei überlappender Sprache
In einem internen Test verarbeiteten wir eine etwa 19 Sekunden lange Aufnahme aus zwei synthetischen Stimmen. Die zweite setzte bei 6.5 Sekunden ein. Der angemeldete Arbeitsbereich lieferte zwei Sprecheroptionen, ein gekennzeichnetes Transkript und zwei herunterladbare WAV-Dateien von ungefähr der Originallänge.
Die Ausgabe Speaker 2 enthielt jedoch zwischen 6.5 und 10 Sekunden digitale Stille. Zwei exportierte Dateien belegen daher keine vollständige Wiederherstellung überlappender Stimmen. Eine Hörprüfung und die Zuordnung von Stimme zu Spur sind noch nicht abgeschlossen. Dies ist eine Signalbeobachtung an einem einzigen synthetischen Beispiel, kein Benchmark realer Interviews und keine Demonstration erfolgreicher Trennung.
Vergleichen Sie jede benötigte Aussage mit dem Original, besonders bei Unterbrechungen. Die volle Dateidauer kann erhalten bleiben, obwohl darin Sprache fehlt.
06. Wenn die Stimmen weiterhin überlagert sind
Bewerten Sie die Trennung an Ihrer eigenen Datei. Fehlen Wörter oder stört die andere Stimme, erwägen Sie einen anderen Ausschnitt, originale Mikrofonaufnahmen oder eine Neuaufnahme. Stellen Sie beschädigte Aussagen nicht als genaue Wiedergabe des Gesagten dar.
Prüfen Sie bei Transkription oder Synchronisation neben dem Klang auch die Sprecherzuordnung. Eine isolierte Spur bestätigt nicht die Richtigkeit von Transkript oder Übersetzung. Unser Leitfaden zur Transkription mehrerer Sprecher behandelt Kennzeichnungen und Skriptprüfung.
Ist das Ausgangsmaterial nutzbar, können Sie mit der Videosynchronisation fortfahren. Bewerten Sie Audiotrennung und übersetztes Skript separat.
07. Häufige Fragen
F. Lassen sich zwei gleichzeitig sprechende Stimmen trennen?
A. Sie können Sprechertrennung an der Mischung ausprobieren. Prüfen Sie die überlappende Passage jeder Ausgabe. Zwei Kennzeichnungen belegen nicht, dass beide Stimmen sauber erhalten sind. Bewahren Sie das Original zum Wort- und Klangvergleich auf.
F. Isoliert ein Vocal Remover eine Person aus einem Interview?
A. Prüfen Sie, was das Werkzeug mit „Vocals“ meint. Eine Ausgabe, die Stimme von Musik trennt, kann beide Personen enthalten. Suchen Sie Einzelspuren und hören Sie jede ab. Transkriptkennzeichnungen sind keine getrennten Audiospuren.
F. Kann ich das Ergebnis als Video herunterladen?
A. Die hier beschriebenen Downloads sind WAV-Audiodateien. Importieren Sie für ein fertiges Video den Ton in Ihren Editor, richten Sie ihn am Bild aus und schalten Sie die Originalmischung stumm. Bei der Prüfung am 29. September nannte der Hinweis den Starter-Tarif für Spurdownloads.
Testen Sie Ihre Aufnahme in Audio Separation. Vergleichen Sie zuerst die schwierige Passage, bevor Sie den vollständigen Schnitt beginnen.
Nutzen Sie zum Trennen zweier Stimmen die ursprünglichen Sprecherspuren, falls sie vorhanden sind. Andernfalls können Sie eine Trennung nach Sprechern ausprobieren. Prüfen Sie vor der Bearbeitung beide Ausgaben.
Ein Podcast-Gast ist zu leise. Ein Interviewer unterbricht eine Antwort. Sie möchten nur die Worte einer Person für einen kurzen Clip nutzen, doch beide Stimmen sind in einer Datei gemischt. Der nächste Schritt hängt davon ab, ob Sie das Aufnahmeprojekt, einzelne Mikrofonspuren oder nur die exportierte Audio- oder Videodatei haben.
Dieser Leitfaden hilft bei der Methodenwahl, der Prüfung getrennter Stimmen und ihrer Verwendung im Schnitt. Geht es um Musik hinter einem Gespräch, lesen Sie zunächst den Leitfaden zum Entfernen von Hintergrundmusik.
01. Die passende Methode auswählen
Vorhandenes Material | Einstieg | Wichtigste Grenze |
|---|---|---|
Originale Mikrofon- oder Aufnahmespuren | Die Spur der gewünschten Person einzeln abhören und exportieren | Das Mikrofon kann auch die andere Stimme aufgenommen haben. |
Gemischte Aufnahme mit abwechselnden Wortbeiträgen | Unerwünschte Abschnitte auf der Zeitleiste schneiden oder stummschalten | Gleichzeitig sprechende Stimmen werden so nicht getrennt. |
Gemischte Aufnahme mit überlappender Sprache | Sprechertrennung an einem kurzen Ausschnitt testen | Auf fehlende Wörter und die verbleibende andere Stimme achten. |

Diagramm zur Methodenwahl, kein Produkt-Screenshot und kein Messergebnis.
Fall 1: Die Originalspuren sind verfügbar
Öffnen Sie das Aufnahmeprojekt und hören Sie die Mikrofonspur der gewünschten Person solo ab. Prüfen Sie, ob die andere Stimme durch Übersprechen hörbar bleibt, und exportieren Sie die nutzbare Spur. So müssen Sie Stimmen nicht aus einer fertigen Mischung rekonstruieren.
Eine Stereodatei hat zwei Kanäle, aber nicht unbedingt einen pro Person. Hören Sie links und rechts einzeln ab, bevor Sie sie als isolierte Sprecher behandeln.
Fall 2: Die Personen sprechen abwechselnd
Für einzelne Passagen genügt möglicherweise der Schnitt auf der Zeitleiste. Behalten Sie die gewünschten Beiträge und senken oder deaktivieren Sie die anderen. Lassen Sie Wortanfänge und Wortenden stehen und prüfen Sie jeden Schnitt auf abrupte Änderungen des Raumklangs.
Entfernen Sie etwa für einen reinen Gast-Clip die Frage nur, wenn die Antwort allein verständlich bleibt. Bewahren Sie den Kontext, wenn sich die Bedeutung sonst verändert.
Fall 3: Beide Stimmen überlagern sich
Wer den gemeinsamen Zeitraum stummschaltet, entfernt beide Stimmen. Testen Sie stattdessen einen kurzen Ausschnitt mit Sprechertrennung und vergleichen Sie jede Ausgabe an derselben Stelle mit dem Original.
Fehlt eine wichtige Aussage, nutzen Sie eine andere Aufnahme, fragen Sie nach der Original-Mikrofonspur oder wählen Sie eine Passage ohne Unterbrechung. Zwei ausgegebene Spuren bedeuten nicht, dass alle Wörter wiederhergestellt wurden.
02. Sprecherkennzeichnungen sind keine getrennten Audiospuren
Die Sprecherdiarisierung erkennt im Transkript, wer wann gesprochen hat. Die Google-Cloud-Dokumentation zur Diarisierung beschreibt beispielsweise Sprecherkennzeichnungen für erkannte Wörter. Daraus entsteht allein noch keine herunterladbare Datei mit nur einer Stimme.
Die Audio-Sprechertrennung soll solche Einzelspuren erzeugen. Prüfen Sie deshalb die tatsächliche Ausgabe eines Werkzeugs. Ein mit Speaker 1 und Speaker 2 gekennzeichnetes Transkript erleichtert die Textbearbeitung, obwohl die Tonaufnahme weiterhin gemischt sein kann.
Auch eine Gesang-/Stimmenspur ist etwas anderes: Sie kann beide Personen mit reduziertem Hintergrund enthalten. Mehr dazu unter Musik-Stimmentfernung und Video-Audiotrennung im Vergleich.
03. Einzelne Sprecherspuren in Perso Dubbing prüfen
1. Einen repräsentativen Ausschnitt wählen
Nehmen Sie einen klaren Satz jeder Person und, falls vorhanden, eine Unterbrechung auf. Bewahren Sie die Originaldatei zum Vergleich auf. Ein einfacher Einleitungssatz zeigt nicht, ob die schwierigste Passage nutzbar ist.
2. Die Datei hochladen
Öffnen Sie Perso Dubbing Audio Separation und verwenden Sie den Upload-Bereich. Prüfen Sie vor der Verarbeitung die angezeigten Dateianforderungen und Testbedingungen.
3. Die benötigte Ausgabe finden
Prüfen Sie nach der Verarbeitung die Spuren. Für die Stimme einer Person benötigen Sie eine Einzelspur. „All Speakers (Vocals)“ enthält die gemeinsamen Stimmen, nicht nur eine Person.
Hören Sie nach, wer welcher nummerierten Spur entspricht. Speaker 1 muss nicht der Moderator sein, und eine erkannte Spur ist nicht automatisch veröffentlichungsreif.
4. Die schwierige Passage vergleichen
Spielen Sie Original und Einzelspuren rund um eine Unterbrechung ab. Prüfen Sie auch einen ruhigen Satz und ein Wortende. Entscheiden Sie anhand der folgenden Checkliste, ob das Ergebnis zum Schnitt passt.
5. Exportieren und im Videoeditor weiterarbeiten
Das Exportmenü führt WAV-Dateien der Sprecher auf. Bei unserer Prüfung am 29. September zeigte der Download-Hinweis an, dass Spurdownloads mit dem Starter-Tarif freigeschaltet werden. Eine Registrierung allein bedeutet keinen kostenlosen Download. Im angemeldeten Arbeitsbereich kombiniert Audio Export die ausgewählten Spuren zu einer Datei. Deaktivieren Sie für einen einzelnen Sprecher die übrigen Spuren und prüfen Sie, ob Selected nur ihn anzeigt. Importieren Sie die Datei in den Editor, richten Sie sie am Original aus und schalten Sie den ursprünglichen Mischton stumm, damit die andere Stimme nicht wieder hinzukommt.
Prüfen Sie vor dem Videoexport die Synchronität am Anfang und später im Clip. Audiotrennung und Videoexport sind separate Schritte.
04. Worauf Sie vor der Verwendung hören sollten
Prüfung | Auffälligkeiten | Vorgehen |
|---|---|---|
Benötigte Wörter | Fehlende Silben, Konsonanten oder veränderte Bedeutung | Dieselbe Aussage mit dem Original vergleichen. Wichtige fehlende Wörter nicht akzeptieren. |
Andere Person | Eine zweite Stimme unter der ausgewählten Stimme | Anderen Schnitt oder originale Einzelaufnahme erwägen. |
Unterbrechungen | Leise oder verzerrte Stimme bei gleichzeitiger Sprache | Überlappungen getrennt von klaren Wortbeiträgen prüfen. |
Stimmklang | Metallischer Klang, abrupte Änderungen, ungleichmäßige Lautstärke | Mit Kopfhörern und einem Gerät des Publikums abhören. |
Timing | Sprache vor oder nach der sichtbaren Mundbewegung | Ausrichtung und Schnittstellen prüfen. |
Eine saubere Passage bestätigt nicht die gesamte Aufnahme. In einem kurzen Interview kann eine beschädigte Antwort wichtiger sein als mehrere klare Minuten.
05. Eine Grenze bei überlappender Sprache
In einem internen Test verarbeiteten wir eine etwa 19 Sekunden lange Aufnahme aus zwei synthetischen Stimmen. Die zweite setzte bei 6.5 Sekunden ein. Der angemeldete Arbeitsbereich lieferte zwei Sprecheroptionen, ein gekennzeichnetes Transkript und zwei herunterladbare WAV-Dateien von ungefähr der Originallänge.
Die Ausgabe Speaker 2 enthielt jedoch zwischen 6.5 und 10 Sekunden digitale Stille. Zwei exportierte Dateien belegen daher keine vollständige Wiederherstellung überlappender Stimmen. Eine Hörprüfung und die Zuordnung von Stimme zu Spur sind noch nicht abgeschlossen. Dies ist eine Signalbeobachtung an einem einzigen synthetischen Beispiel, kein Benchmark realer Interviews und keine Demonstration erfolgreicher Trennung.
Vergleichen Sie jede benötigte Aussage mit dem Original, besonders bei Unterbrechungen. Die volle Dateidauer kann erhalten bleiben, obwohl darin Sprache fehlt.
06. Wenn die Stimmen weiterhin überlagert sind
Bewerten Sie die Trennung an Ihrer eigenen Datei. Fehlen Wörter oder stört die andere Stimme, erwägen Sie einen anderen Ausschnitt, originale Mikrofonaufnahmen oder eine Neuaufnahme. Stellen Sie beschädigte Aussagen nicht als genaue Wiedergabe des Gesagten dar.
Prüfen Sie bei Transkription oder Synchronisation neben dem Klang auch die Sprecherzuordnung. Eine isolierte Spur bestätigt nicht die Richtigkeit von Transkript oder Übersetzung. Unser Leitfaden zur Transkription mehrerer Sprecher behandelt Kennzeichnungen und Skriptprüfung.
Ist das Ausgangsmaterial nutzbar, können Sie mit der Videosynchronisation fortfahren. Bewerten Sie Audiotrennung und übersetztes Skript separat.
07. Häufige Fragen
F. Lassen sich zwei gleichzeitig sprechende Stimmen trennen?
A. Sie können Sprechertrennung an der Mischung ausprobieren. Prüfen Sie die überlappende Passage jeder Ausgabe. Zwei Kennzeichnungen belegen nicht, dass beide Stimmen sauber erhalten sind. Bewahren Sie das Original zum Wort- und Klangvergleich auf.
F. Isoliert ein Vocal Remover eine Person aus einem Interview?
A. Prüfen Sie, was das Werkzeug mit „Vocals“ meint. Eine Ausgabe, die Stimme von Musik trennt, kann beide Personen enthalten. Suchen Sie Einzelspuren und hören Sie jede ab. Transkriptkennzeichnungen sind keine getrennten Audiospuren.
F. Kann ich das Ergebnis als Video herunterladen?
A. Die hier beschriebenen Downloads sind WAV-Audiodateien. Importieren Sie für ein fertiges Video den Ton in Ihren Editor, richten Sie ihn am Bild aus und schalten Sie die Originalmischung stumm. Bei der Prüfung am 29. September nannte der Hinweis den Starter-Tarif für Spurdownloads.
Testen Sie Ihre Aufnahme in Audio Separation. Vergleichen Sie zuerst die schwierige Passage, bevor Sie den vollständigen Schnitt beginnen.
Weiterlesen
Alle durchsuchen
PRODUKT
Synchronisation & Übersetzung
Transkription & Untertitel
LÖSUNGEN
Business
ENTWICKLER
RESSOURCE
Lernen
UNTERNEHMEN
Lösungen
ESTsoft Inc. 15770 Laguna Canyon Rd #250, Irvine, CA 92618
PRODUKT
Synchronisation & Übersetzung
Transkription & Untertitel
LÖSUNGEN
Business
ENTWICKLER
RESSOURCE
Lernen
UNTERNEHMEN
Lösungen
ESTsoft Inc. 15770 Laguna Canyon Rd #250, Irvine, CA 92618





