Trennen Sie Gesang, Sprecher und Musik
Kostenlos, online, in Sekunden
Lief bei der Aufnahme Musik? Störendes Rauschen im Hintergrund? Ziehen Sie unten eine beliebige Audio- oder Videodatei hinein – Perso Dubbing teilt sie in Gesang, einzelne Sprecher und Hintergrundmusik auf, und Sie hören jede Spur schon vor der Anmeldung.
Keine Anmeldung nötig · Erste 60 Sekunden kostenlos · Dateien werden nie gespeichert
Klicken oder Datei per Drag & Drop ablegen
Trennung startet sofort – kein Konto nötig (bis zu 200 MB)
Keine Datei zur Hand? Probiere ein Beispiel:
Audiospuren werden getrennt...
Klangfrequenzen werden analysiert, um die Stimme von Hintergrundgeräuschen zu trennen
Im Workspace bearbeiten Sie Sprecher-Skripte Zeile für Zeile
Tageslimit für heute erreicht
Sie haben die 3 kostenlosen Trennungen für heute aufgebraucht. Registrieren Sie sich kostenlos, um weiterzumachen.
Der Starter-Tarif hebt das Tageslimit auf.
Weltklasse-Leistung — gemessen, nicht behauptet
Drei branchenübliche öffentliche Benchmarks: MUSDB18 für Gesangstrennung, VoiceBank-DEMAND für Rauschentfernung und das Open ASR Leaderboard für Transkription. Dieselben Datensätze wie in jeder Forschungsarbeit, gegen namentlich genannte Engines — mit veröffentlichten Einzelergebnissen, damit jeder die Tests nachvollziehen kann.
Gesangstrennung höher = besser
Sieg bei 44 von 50 Tracks — und wo wir verlieren, beträgt der Abstand höchstens 0.66 dB.
Qualität der Rauschentfernung höher = besser
Der Spezialist DeepFilterNet3 führt hauchdünn (2.77 gegenüber 2.64) — beide weit vor ElevenLabs.
Sprachverständlichkeit höher = besser
Die ersten beiden liegen praktisch gleichauf. ElevenLabs macht Sprache bei der Hälfte der Proben schwerer verständlich — wir verbessern sie bei 96%.
Stimmklon-Treue höher = besser
Platz eins in beiden getesteten Klonsystemen — sogar im hauseigenen Kloner von ElevenLabs. Der gestreifte Balken ist das saubere Original: die natürliche Obergrenze.
Transkriptionsgenauigkeit (WER) niedriger = besser
Insgesamt ein statistisches Unentschieden mit Scribe v2 — aber bei Inhalten mit mehreren Sprechern wie Podcasts liegen wir vorn (kürzerer Balken = weniger Fehler).
Die Balken sind auf den Wettbewerbsbereich gezoomt, damit kleine Unterschiede sichtbar bleiben — entscheidend ist der exakte Wert neben jedem Balken.
Was messen diese Tests eigentlich?
🎯 Gesangstrennung (SI-SDR) Höher = besser
Wie sauber Stimme und Musik getrennt werden — wie eine Karaoke-Spur ganz ohne Stimmreste. Unser Wert: 10.67 dB gegenüber 8.36 dB bei HTDemucs — weniger Übersprechen zwischen den Spuren, Sieg bei 44 von 50 Songs.
🔊 Rauschentfernung (PESQ · ESTOI) Höher = besser
Wie klar und natürlich Sprache nach der Rauschentfernung klingt — dieselbe Metrik wie bei der Bewertung von Telefonqualität. Wir erreichen 2.64, knapp hinter dem Spezialisten DeepFilterNet3 (2.77) und deutlich vor ElevenLabs (2.38). Bei der Verständlichkeit teilen wir uns Platz eins.
📝 Transkriptionsgenauigkeit (WER) Niedriger = besser
Wie viele von 100 gesprochenen Wörtern falsch erfasst werden. Unsere 7.61% bedeuten rund 92 von 100 richtigen Wörtern — statistisch gleichauf mit ElevenLabs Scribe v2 (7.52%) und voraus bei Aufnahmen mit mehreren Sprechern wie Podcasts.
🎤 Stimmklon-Treue (cos_sim) Höher = besser
Klingt ein Stimmklon aus dem bereinigten Audio noch nach derselben Person? Bewertet von 0 bis 1 gegen die Originalstimme. Unsere 0.674 belegen Platz eins in beiden getesteten Klonsystemen — sogar im hauseigenen Kloner von ElevenLabs.
Ehrliche Fußnoten: Die Gesangstrennung wird am MUSDB18-Sampleset gemessen (vollständiger MUSDB18-HQ-Durchlauf läuft, erwartet innerhalb von ±0.5 dB). DeepFilterNet3 liegt bei PESQ um 0.15 vorn — bei der Verständlichkeit sind wir gleichauf, bei der Wellenform-Treue führen wir (+18.66 gegenüber +17.31 dB SI-SDR). MDX-Net und LALAL.AI wurden noch nicht getestet, daher behaupten wir nicht, jeden Separator zu schlagen. Verifiziert im Mai 2026.
Drei Schritte, unter einer Minute
Datei hochladen
Ziehen Sie eine Audio- oder Videodatei per Drag & Drop — MP3, WAV, M4A, MP4, MOV oder WebM, bis 200MB. Für die ersten 60 Sekunden ist kein Konto nötig.
Getrennte Spuren anhören
Die KI zerlegt Ihre Datei in einzelne Sprecher, reine Hintergrundmusik und Hintergrund mit Reaktionen. Spielen Sie jede Spur direkt im Browser ab.
Mix exportieren
Wählen Sie die gewünschten Spuren und exportieren Sie sie als eine Datei. Melden Sie sich an, um herunterzuladen oder längere Dateien vollständig zu verarbeiten.
Mehr als ein Vocal Remover
😂 Zwei Hintergrund-Audio-Modi
Reine Hintergrundmusik — oder Musik mit Lachen und Applaus. Kein anderes Trennungstool bietet beides aus einem einzigen Upload.
👤 Mehrsprecher-Trennung
Nicht nur Stimme gegen Musik — die Sprechertrennung gibt jeder Person in der Aufnahme eine eigene Spur, plus ein sprecherbezogenes Transkript in 99+ Sprachen.
🔒 Nichts wird gespeichert
Testdateien werden temporär verarbeitet und beim Sitzungsende gelöscht. Sie werden nie aufbewahrt und nie für Training verwendet.
📝 Transkription in 99+ Sprachen
Jede Trennung enthält automatische Sprache-zu-Text-Umwandlung mit Sprecherkennzeichnung, direkt neben Ihren Spuren. Die Spracherkennung läuft automatisch — ohne Zusatztools, ohne Extraschritte.
🎬 Für Audio & Video
Laden Sie MP3, WAV, M4A, MP4, MOV oder WebM hoch. Exportieren Sie Spuren mit eingebetteten Untertiteln oder separaten SRT-Dateien.
🎚 Selektiver Mix-Export
Kombinieren Sie beliebige Spuren zu einer Datei — zum Beispiel Hintergrundmusik plus Sprecher 1. Kein anderes Tool exportiert einen eigenen Mix in einem Schritt.
Hintergrundmusik oder Rauschen aus Ihrem Video entfernen – auf zwei Wegen
Das Lachen im Podcast, die Reaktion des Publikums, ein Husten während der Keynote — die meisten Vocal Remover können das nicht von Sprache unterscheiden. Perso Dubbing liefert beide Optionen aus einem einzigen Upload.
Hintergrundmusik
Entfernt jeden menschlichen Laut — Sprache, Lachen, Klatschen — und lässt nur den Hintergrundton übrig. Ideal für lizenzfreie BGM und saubere Audiobetten fürs Nachvertonen.
Hintergrund mit Reaktionen
Entfernt nur die Sprache und bewahrt Lachen, Applaus und die Energie des Publikums. Perfekt für Podcasts, Live-Events und Shows, bei denen Atmosphäre zählt.
Eine Spur pro Stimme — Sprechertrennung für Interviews, Podcasts und Meetings
Die meisten Vocal Remover enden bei zwei Stems: Stimme und Musik. Die Mehrsprecher-Trennung von Perso Dubbing geht weiter — die KI erkennt, wie viele Personen sprechen, und teilt die Aufnahme in einzelne Sprecherspuren auf, jede mit einem beschrifteten Transkript in 99+ Sprachen.
Eine gemischte Aufnahme
Eine Interview-, Podcast- oder Meeting-Aufnahme, in der mehrere Personen über Musik und Raumgeräusche sprechen — hochgeladen als einzelne Audio- oder Videodatei.
Eine eigene Spur für jeden Sprecher
Trennen Sie Sprecher mit einem Klick aus dem Audio: Exportieren Sie die Spur eines einzelnen Sprechers oder jede beliebige Mischung — ohne manuelle Bearbeitung.
Wer nutzt Audio-Trennung?
🛡 Copyright-Probleme lösen
Entfernen Sie geschützte Hintergrundmusik bei intaktem Dialog, tauschen Sie lizenzfreie Musik ein und laden Sie das Video ohne Claims neu hoch.
🎙 Podcast-Schnitt
Schneiden Sie Füllwörter und unerwünschte Sprache heraus, während Publikumslachen und Reaktionen unangetastet bleiben.
🌍 Video-Dubbing
Extrahieren Sie eine saubere BGM-Spur ohne Sprachreste und legen Sie ein neues Voice-over in einer von über 99 Sprachen darüber.
💼 Meetings & Konferenzen
Trennen Sie Sprecher aus dem Audio von Zoom- oder Meet-Aufnahmen — jeder Teilnehmer erhält eine eigene Spur, mit integrierten, sprecherbezogenen Transkripten.
📱 Social-Media-Clips
Tauschen Sie die Original-BGM in Kurzvideos gegen einen Trend-Track — ohne Ihr Voice-over anzurühren.
🎤 Konzerte & Fancams
Entfernen Sie Publikumslärm und Raumhall aus Live-Clips, um die Stimme des Künstlers oder die Musik zu isolieren.
📰 Journalismus & Interviews
Nutzen Sie die Mehrsprecher-Trennung, um die Stimme jedes Interviewten aus verrauschten Außenaufnahmen zu isolieren — mit sauberen Transkripten für den Faktencheck.
♻️ Inhalte wiederverwenden
Aus einem Upload werden Podcast-Audio, Promo-BGM, Sprecher-Clips für Social Media und ein vollständiges Transkript für Ihren Blog.
Mehr Möglichkeiten im Perso Workspace
Häufige Fragen
Ist Perso Dubbing Audio Separation kostenlos?
Brauche ich ein Konto, um die Audio-Trennung zu testen?
Was passiert, wenn meine Datei länger als 60 Sekunden ist?
Werden meine Dateien auf Perso-AI-Servern gespeichert?
Welche Dateiformate und -größen werden unterstützt?
Was unterscheidet „Hintergrundmusik“ von „Hintergrund mit Reaktionen“?
Kann Perso Dubbing Mehrsprecher-Trennung, nicht nur Gesang und Musik?
Wie genau ist die Trennung von Perso Dubbing im Vergleich zu anderen Tools?
Kann ich urheberrechtlich geschützte Musik aus meinem Video entfernen?
Wie entferne ich Hintergrundmusik aus einem selbst gedrehten Video?
Was unterscheidet Perso Dubbing von LALAL.AI oder Moises?
Kann ich ausgewählte Spuren zu einer Datei kombinieren?
Entdecken Sie unsere Produktfunktionen
Testen Sie es mit Ihrer eigenen Datei — jetzt gleich
Die ersten 60 Sekunden sind kostenlos. Keine Registrierung, keine gespeicherten Dateien, kein Haken.
↑ Datei hochladen
EN
KO
ES
PT
RU
ID
DE
TH
JP
TC