하나의 녹음에서 두 사람의 목소리를 분리하는 방법

AI 더빙, 영상 번역, 음성 번역, 립싱크
무료로 사용해보기
하나의 녹음에서 두 사람의 목소리를 분리하려면 원본 화자별 트랙이 있는지 먼저 확인하세요. 없다면 화자별 음성 분리를 시도하고, 편집 전에 두 출력 파일을 모두 확인하세요.
팟캐스트 게스트의 목소리가 너무 작거나, 인터뷰어가 답변 중 끼어들거나, 짧은 클립에 한 사람의 말만 넣고 싶을 수 있습니다. 두 목소리가 한 파일에 섞여 있다면 녹음 프로젝트, 개별 마이크 트랙, 최종 오디오·영상 중 무엇을 보유하고 있는지에 따라 방법이 달라집니다.
이 가이드는 적절한 방법을 선택하고, 분리된 음성을 확인하고, 필요한 목소리를 편집본에 넣는 과정을 안내합니다. 대화 뒤의 음악을 없애려는 목적이라면 배경음악 제거 가이드를 먼저 보세요.
01. 녹음 상태에 맞는 방법 선택하기
보유한 자료 | 시작 방법 | 주요 한계 |
|---|---|---|
원본 마이크 또는 녹음 트랙 | 필요한 사람의 원본 트랙만 재생하고 내보내기 | 다른 사람의 목소리가 해당 마이크에 함께 녹음됐을 수 있습니다. |
번갈아 말하는 혼합 녹음 | 타임라인에서 불필요한 발화 구간을 자르거나 음소거 | 동시에 말하는 목소리는 이 방법으로 분리되지 않습니다. |
발화가 겹치는 혼합 녹음 | 짧은 구간에서 화자별 분리 시도 | 단어 누락과 다른 목소리가 남는지 확인해야 합니다. |

방법 선택을 돕는 도식이며, 제품 화면이나 성능 측정 결과가 아닙니다.
상황 1: 원본 트랙이 있는 경우
원본 녹음 프로젝트에서 필요한 사람의 마이크 트랙만 재생하세요. 다른 사람의 소리가 마이크에 함께 들어왔는지 확인한 뒤 사용할 수 있는 트랙을 내보내세요. 완성된 혼합 파일에서 목소리를 복원하는 과정을 줄일 수 있습니다.
스테레오 파일의 두 채널이 반드시 서로 다른 사람을 뜻하지는 않습니다. 왼쪽과 오른쪽 채널을 각각 들어본 뒤 독립된 화자 트랙인지 판단하세요.
상황 2: 화자가 번갈아 말하는 경우
일부 발화만 필요하다면 타임라인 편집으로 충분할 수 있습니다. 필요한 사람의 구간은 남기고 나머지 구간의 음량을 낮추거나 음소거하세요. 각 단어의 시작과 끝을 보존하고, 편집 지점마다 주변 소리가 갑자기 바뀌지 않는지 확인하세요.
예를 들어 질문과 답변에서 게스트만 나오는 클립을 만들 때는 답변만으로도 의미가 통하는 경우에만 질문을 삭제하세요. 질문을 빼면 뜻이 달라지는 경우 맥락을 유지해야 합니다.
상황 3: 두 목소리가 동시에 겹치는 경우
겹치는 시간대를 음소거하면 두 사람의 소리가 모두 사라집니다. 대신 짧은 구간에 화자별 분리를 적용하고, 같은 시점의 각 출력을 원본과 비교하세요.
중요한 문장이 누락됐다면 다른 테이크를 쓰거나 원본 마이크 트랙을 요청하거나, 끼어들기가 없는 구간을 선택하세요. 트랙 두 개가 나왔다고 모든 단어가 복원됐다고 가정하지 마세요.
02. 화자 표시와 분리된 오디오 트랙은 다릅니다
화자 분할은 전사문에서 누가 언제 말했는지 표시하는 기능입니다. 예를 들어 Google Cloud의 화자 분할 문서는 인식된 단어에 화자 표시를 붙이는 방식을 설명합니다. 이것만으로 한 사람의 목소리만 담긴 다운로드용 파일이 생기지는 않습니다.
화자별 음성 분리는 개별 음성 트랙을 만드는 것을 목표로 합니다. 도구를 선택하기 전에 실제 출력 형식을 확인하세요. Speaker 1과 Speaker 2가 표시된 전사문은 텍스트 편집에는 도움이 되지만 원본 오디오는 여전히 섞여 있을 수 있습니다.
보컬 트랙도 다른 개념입니다. 배경음이 줄어든 상태로 두 사람의 음성을 모두 담을 수 있습니다. 자세한 내용은 음악용 보컬 제거와 영상 음성 분리의 차이를 참고하세요.
03. Perso Dubbing에서 화자별 트랙 확인하기
1. 대표적인 짧은 구간 선택
각 사람이 또렷하게 말하는 문장과, 있다면 끼어들기 구간을 포함하세요. 비교용 원본을 보관하세요. 쉬운 첫 문장만으로는 가장 복잡한 부분의 사용 가능 여부를 판단할 수 없습니다.
2. 파일 업로드
Perso Dubbing 음성 분리의 업로드 영역을 이용하세요. 처리 전에 현재 표시된 파일 요건과 체험 조건을 확인하세요.
3. 필요한 출력 찾기
처리 후 제공되는 트랙을 확인하세요. 한 사람의 목소리가 필요하면 개별 화자 트랙을 찾으세요. “All Speakers (Vocals)”는 한 사람이 아닌 모든 화자의 음성을 뜻합니다.
번호별 트랙을 들어보고 누구의 목소리인지 확인하세요. Speaker 1이 항상 진행자라고 생각하거나, 검출된 트랙을 곧바로 게시할 수 있다고 가정하지 마세요.
4. 어려운 구간 비교
끼어들기 전후의 원본과 각 화자 트랙을 재생하세요. 이어서 조용한 문장과 단어 끝부분을 확인하세요. 아래 체크리스트로 편집에 쓸 수 있는지 판단하세요.
5. 내보낸 뒤 영상 편집기로 이동
내보내기 메뉴에는 화자별 WAV 파일이 표시됩니다. 9월 29일 점검 시 다운로드 안내에는 Starter 플랜에서 트랙 다운로드를 제공한다고 표시됐습니다. 회원가입만으로 무료 다운로드가 가능하다고 가정하면 안 됩니다. 로그인된 작업공간의 Audio Export는 선택한 트랙을 하나로 합칩니다. 한 화자만 내보내려면 다른 트랙을 해제하고 Selected 표시가 해당 화자만 보여주는지 확인하세요. 영상 제작 시 이 오디오를 편집기에 넣고 원본과 시간을 맞춘 뒤, 원본 혼합 오디오는 음소거해 다른 목소리가 다시 섞이지 않게 하세요.
최종 영상 내보내기 전에 시작 부분과 뒤쪽의 싱크를 확인하세요. 이 과정에서 음성 분리와 영상 내보내기는 별도 단계입니다.
04. 결과를 사용하기 전 들어볼 항목
확인 항목 | 주의해서 들을 부분 | 대응 |
|---|---|---|
필요한 말 | 음절·자음 누락 또는 의미 변화 | 원본의 같은 문장과 비교하세요. 중요한 단어가 사라졌다면 사용하지 마세요. |
다른 화자 | 선택한 목소리 아래 남아 있는 다른 사람의 소리 | 편집 방식 변경이나 원본 개별 녹음이 필요한지 판단하세요. |
끼어들기 | 동시에 말할 때 작아지거나 왜곡되는 음성 | 겹치는 구간과 번갈아 말하는 구간을 따로 검수하세요. |
음색 | 금속성 소리, 갑작스러운 변화, 불균일한 음량 | 헤드폰과 시청자가 사용할 기기에서 들어보세요. |
타이밍 | 입 모양보다 빠르거나 느린 발화 | 트랙 정렬과 편집 중 잘라낸 부분을 확인하세요. |
깨끗한 한 구간을 들었다고 전체 녹음이 검증되는 것은 아닙니다. 짧은 인터뷰에서는 깨끗한 몇 분보다 손상된 답변 하나가 더 중요할 수 있습니다.
05. 겹치는 발화에서 확인할 한계
내부 테스트에서 합성 음성 두 개로 약 19초 녹음을 만들고 두 번째 음성을 6.5초에 시작했습니다. 로그인된 작업공간은 두 화자 선택지, 화자가 표시된 전사문, 원본과 거의 같은 길이의 WAV 두 개를 제공했습니다.
그러나 Speaker 2 출력의 6.5~10초는 디지털 무음이었습니다. 따라서 파일 두 개가 나왔다는 사실만으로 겹친 목소리가 완전히 복원됐다고 볼 수 없습니다. 청취 검수와 음성·트랙 대응 확인은 완료하지 않았습니다. 이는 합성 샘플 하나의 신호 수준 관찰이며, 실제 인터뷰 벤치마크나 분리 성공 시연이 아닙니다.
실무에서는 필요한 모든 문장을 원본과 비교하세요. 특히 서로 끼어드는 부분을 확인해야 합니다. 파일 전체 길이가 유지돼도 그 안의 발화는 누락될 수 있습니다.
06. 목소리가 계속 겹쳐 들린다면
분리 결과는 자신의 파일로 평가해야 합니다. 필요한 말이 사라졌거나 다른 목소리가 방해된다면 다른 구간, 원본 마이크 녹음, 가능하다면 재녹음을 고려하세요. 손상된 문장을 실제 발언의 정확한 기록으로 제시하지 마세요.
전사나 더빙에서는 소리뿐 아니라 화자 배정도 검토하세요. 분리된 오디오가 있다고 전사나 번역까지 정확한 것은 아닙니다. 다화자 전사 가이드는 화자 표시와 스크립트 검수를 설명합니다.
원본을 사용할 수 있는 상태가 되면 영상 더빙으로 넘어갈 수 있습니다. 음성 분리 검수와 번역 스크립트 검수는 별도로 판단하세요.
07. 자주 묻는 질문
Q. 동시에 말하는 두 목소리도 분리할 수 있나요?
A. 혼합 녹음에 화자별 분리를 시도할 수 있습니다. 각 출력의 겹치는 구간을 확인하세요. 화자 표시가 두 개 있다는 사실만으로 두 음성이 깨끗하게 보존됐다고 볼 수는 없습니다. 말과 소리를 비교할 원본을 보관하세요.
Q. 보컬 제거기로 인터뷰에서 한 사람만 분리할 수 있나요?
A. 도구에서 말하는 ‘보컬’의 의미를 확인하세요. 목소리와 음악을 나누는 출력에는 두 화자가 함께 남을 수 있습니다. 개별 화자 오디오 출력을 찾아 각각 들어보세요. 전사문의 화자 표시는 분리된 오디오 트랙과 다릅니다.
Q. 결과를 영상으로 다운로드할 수 있나요?
A. 여기서 설명한 화자 다운로드는 WAV 오디오입니다. 완성된 영상을 만들려면 선택한 오디오를 영상 편집기에 넣고 화면과 시간을 맞춘 뒤 원본 혼합 오디오를 음소거하세요. 9월 29일 확인한 다운로드 안내에는 Starter 플랜에서 트랙 다운로드를 제공한다고 표시됐습니다.
음성 분리에서 자신의 녹음을 테스트하세요. 전체 편집을 시작하기 전에 어려운 구간을 비교하세요.
하나의 녹음에서 두 사람의 목소리를 분리하려면 원본 화자별 트랙이 있는지 먼저 확인하세요. 없다면 화자별 음성 분리를 시도하고, 편집 전에 두 출력 파일을 모두 확인하세요.
팟캐스트 게스트의 목소리가 너무 작거나, 인터뷰어가 답변 중 끼어들거나, 짧은 클립에 한 사람의 말만 넣고 싶을 수 있습니다. 두 목소리가 한 파일에 섞여 있다면 녹음 프로젝트, 개별 마이크 트랙, 최종 오디오·영상 중 무엇을 보유하고 있는지에 따라 방법이 달라집니다.
이 가이드는 적절한 방법을 선택하고, 분리된 음성을 확인하고, 필요한 목소리를 편집본에 넣는 과정을 안내합니다. 대화 뒤의 음악을 없애려는 목적이라면 배경음악 제거 가이드를 먼저 보세요.
01. 녹음 상태에 맞는 방법 선택하기
보유한 자료 | 시작 방법 | 주요 한계 |
|---|---|---|
원본 마이크 또는 녹음 트랙 | 필요한 사람의 원본 트랙만 재생하고 내보내기 | 다른 사람의 목소리가 해당 마이크에 함께 녹음됐을 수 있습니다. |
번갈아 말하는 혼합 녹음 | 타임라인에서 불필요한 발화 구간을 자르거나 음소거 | 동시에 말하는 목소리는 이 방법으로 분리되지 않습니다. |
발화가 겹치는 혼합 녹음 | 짧은 구간에서 화자별 분리 시도 | 단어 누락과 다른 목소리가 남는지 확인해야 합니다. |

방법 선택을 돕는 도식이며, 제품 화면이나 성능 측정 결과가 아닙니다.
상황 1: 원본 트랙이 있는 경우
원본 녹음 프로젝트에서 필요한 사람의 마이크 트랙만 재생하세요. 다른 사람의 소리가 마이크에 함께 들어왔는지 확인한 뒤 사용할 수 있는 트랙을 내보내세요. 완성된 혼합 파일에서 목소리를 복원하는 과정을 줄일 수 있습니다.
스테레오 파일의 두 채널이 반드시 서로 다른 사람을 뜻하지는 않습니다. 왼쪽과 오른쪽 채널을 각각 들어본 뒤 독립된 화자 트랙인지 판단하세요.
상황 2: 화자가 번갈아 말하는 경우
일부 발화만 필요하다면 타임라인 편집으로 충분할 수 있습니다. 필요한 사람의 구간은 남기고 나머지 구간의 음량을 낮추거나 음소거하세요. 각 단어의 시작과 끝을 보존하고, 편집 지점마다 주변 소리가 갑자기 바뀌지 않는지 확인하세요.
예를 들어 질문과 답변에서 게스트만 나오는 클립을 만들 때는 답변만으로도 의미가 통하는 경우에만 질문을 삭제하세요. 질문을 빼면 뜻이 달라지는 경우 맥락을 유지해야 합니다.
상황 3: 두 목소리가 동시에 겹치는 경우
겹치는 시간대를 음소거하면 두 사람의 소리가 모두 사라집니다. 대신 짧은 구간에 화자별 분리를 적용하고, 같은 시점의 각 출력을 원본과 비교하세요.
중요한 문장이 누락됐다면 다른 테이크를 쓰거나 원본 마이크 트랙을 요청하거나, 끼어들기가 없는 구간을 선택하세요. 트랙 두 개가 나왔다고 모든 단어가 복원됐다고 가정하지 마세요.
02. 화자 표시와 분리된 오디오 트랙은 다릅니다
화자 분할은 전사문에서 누가 언제 말했는지 표시하는 기능입니다. 예를 들어 Google Cloud의 화자 분할 문서는 인식된 단어에 화자 표시를 붙이는 방식을 설명합니다. 이것만으로 한 사람의 목소리만 담긴 다운로드용 파일이 생기지는 않습니다.
화자별 음성 분리는 개별 음성 트랙을 만드는 것을 목표로 합니다. 도구를 선택하기 전에 실제 출력 형식을 확인하세요. Speaker 1과 Speaker 2가 표시된 전사문은 텍스트 편집에는 도움이 되지만 원본 오디오는 여전히 섞여 있을 수 있습니다.
보컬 트랙도 다른 개념입니다. 배경음이 줄어든 상태로 두 사람의 음성을 모두 담을 수 있습니다. 자세한 내용은 음악용 보컬 제거와 영상 음성 분리의 차이를 참고하세요.
03. Perso Dubbing에서 화자별 트랙 확인하기
1. 대표적인 짧은 구간 선택
각 사람이 또렷하게 말하는 문장과, 있다면 끼어들기 구간을 포함하세요. 비교용 원본을 보관하세요. 쉬운 첫 문장만으로는 가장 복잡한 부분의 사용 가능 여부를 판단할 수 없습니다.
2. 파일 업로드
Perso Dubbing 음성 분리의 업로드 영역을 이용하세요. 처리 전에 현재 표시된 파일 요건과 체험 조건을 확인하세요.
3. 필요한 출력 찾기
처리 후 제공되는 트랙을 확인하세요. 한 사람의 목소리가 필요하면 개별 화자 트랙을 찾으세요. “All Speakers (Vocals)”는 한 사람이 아닌 모든 화자의 음성을 뜻합니다.
번호별 트랙을 들어보고 누구의 목소리인지 확인하세요. Speaker 1이 항상 진행자라고 생각하거나, 검출된 트랙을 곧바로 게시할 수 있다고 가정하지 마세요.
4. 어려운 구간 비교
끼어들기 전후의 원본과 각 화자 트랙을 재생하세요. 이어서 조용한 문장과 단어 끝부분을 확인하세요. 아래 체크리스트로 편집에 쓸 수 있는지 판단하세요.
5. 내보낸 뒤 영상 편집기로 이동
내보내기 메뉴에는 화자별 WAV 파일이 표시됩니다. 9월 29일 점검 시 다운로드 안내에는 Starter 플랜에서 트랙 다운로드를 제공한다고 표시됐습니다. 회원가입만으로 무료 다운로드가 가능하다고 가정하면 안 됩니다. 로그인된 작업공간의 Audio Export는 선택한 트랙을 하나로 합칩니다. 한 화자만 내보내려면 다른 트랙을 해제하고 Selected 표시가 해당 화자만 보여주는지 확인하세요. 영상 제작 시 이 오디오를 편집기에 넣고 원본과 시간을 맞춘 뒤, 원본 혼합 오디오는 음소거해 다른 목소리가 다시 섞이지 않게 하세요.
최종 영상 내보내기 전에 시작 부분과 뒤쪽의 싱크를 확인하세요. 이 과정에서 음성 분리와 영상 내보내기는 별도 단계입니다.
04. 결과를 사용하기 전 들어볼 항목
확인 항목 | 주의해서 들을 부분 | 대응 |
|---|---|---|
필요한 말 | 음절·자음 누락 또는 의미 변화 | 원본의 같은 문장과 비교하세요. 중요한 단어가 사라졌다면 사용하지 마세요. |
다른 화자 | 선택한 목소리 아래 남아 있는 다른 사람의 소리 | 편집 방식 변경이나 원본 개별 녹음이 필요한지 판단하세요. |
끼어들기 | 동시에 말할 때 작아지거나 왜곡되는 음성 | 겹치는 구간과 번갈아 말하는 구간을 따로 검수하세요. |
음색 | 금속성 소리, 갑작스러운 변화, 불균일한 음량 | 헤드폰과 시청자가 사용할 기기에서 들어보세요. |
타이밍 | 입 모양보다 빠르거나 느린 발화 | 트랙 정렬과 편집 중 잘라낸 부분을 확인하세요. |
깨끗한 한 구간을 들었다고 전체 녹음이 검증되는 것은 아닙니다. 짧은 인터뷰에서는 깨끗한 몇 분보다 손상된 답변 하나가 더 중요할 수 있습니다.
05. 겹치는 발화에서 확인할 한계
내부 테스트에서 합성 음성 두 개로 약 19초 녹음을 만들고 두 번째 음성을 6.5초에 시작했습니다. 로그인된 작업공간은 두 화자 선택지, 화자가 표시된 전사문, 원본과 거의 같은 길이의 WAV 두 개를 제공했습니다.
그러나 Speaker 2 출력의 6.5~10초는 디지털 무음이었습니다. 따라서 파일 두 개가 나왔다는 사실만으로 겹친 목소리가 완전히 복원됐다고 볼 수 없습니다. 청취 검수와 음성·트랙 대응 확인은 완료하지 않았습니다. 이는 합성 샘플 하나의 신호 수준 관찰이며, 실제 인터뷰 벤치마크나 분리 성공 시연이 아닙니다.
실무에서는 필요한 모든 문장을 원본과 비교하세요. 특히 서로 끼어드는 부분을 확인해야 합니다. 파일 전체 길이가 유지돼도 그 안의 발화는 누락될 수 있습니다.
06. 목소리가 계속 겹쳐 들린다면
분리 결과는 자신의 파일로 평가해야 합니다. 필요한 말이 사라졌거나 다른 목소리가 방해된다면 다른 구간, 원본 마이크 녹음, 가능하다면 재녹음을 고려하세요. 손상된 문장을 실제 발언의 정확한 기록으로 제시하지 마세요.
전사나 더빙에서는 소리뿐 아니라 화자 배정도 검토하세요. 분리된 오디오가 있다고 전사나 번역까지 정확한 것은 아닙니다. 다화자 전사 가이드는 화자 표시와 스크립트 검수를 설명합니다.
원본을 사용할 수 있는 상태가 되면 영상 더빙으로 넘어갈 수 있습니다. 음성 분리 검수와 번역 스크립트 검수는 별도로 판단하세요.
07. 자주 묻는 질문
Q. 동시에 말하는 두 목소리도 분리할 수 있나요?
A. 혼합 녹음에 화자별 분리를 시도할 수 있습니다. 각 출력의 겹치는 구간을 확인하세요. 화자 표시가 두 개 있다는 사실만으로 두 음성이 깨끗하게 보존됐다고 볼 수는 없습니다. 말과 소리를 비교할 원본을 보관하세요.
Q. 보컬 제거기로 인터뷰에서 한 사람만 분리할 수 있나요?
A. 도구에서 말하는 ‘보컬’의 의미를 확인하세요. 목소리와 음악을 나누는 출력에는 두 화자가 함께 남을 수 있습니다. 개별 화자 오디오 출력을 찾아 각각 들어보세요. 전사문의 화자 표시는 분리된 오디오 트랙과 다릅니다.
Q. 결과를 영상으로 다운로드할 수 있나요?
A. 여기서 설명한 화자 다운로드는 WAV 오디오입니다. 완성된 영상을 만들려면 선택한 오디오를 영상 편집기에 넣고 화면과 시간을 맞춘 뒤 원본 혼합 오디오를 음소거하세요. 9월 29일 확인한 다운로드 안내에는 Starter 플랜에서 트랙 다운로드를 제공한다고 표시됐습니다.
음성 분리에서 자신의 녹음을 테스트하세요. 전체 편집을 시작하기 전에 어려운 구간을 비교하세요.
하나의 녹음에서 두 사람의 목소리를 분리하려면 원본 화자별 트랙이 있는지 먼저 확인하세요. 없다면 화자별 음성 분리를 시도하고, 편집 전에 두 출력 파일을 모두 확인하세요.
팟캐스트 게스트의 목소리가 너무 작거나, 인터뷰어가 답변 중 끼어들거나, 짧은 클립에 한 사람의 말만 넣고 싶을 수 있습니다. 두 목소리가 한 파일에 섞여 있다면 녹음 프로젝트, 개별 마이크 트랙, 최종 오디오·영상 중 무엇을 보유하고 있는지에 따라 방법이 달라집니다.
이 가이드는 적절한 방법을 선택하고, 분리된 음성을 확인하고, 필요한 목소리를 편집본에 넣는 과정을 안내합니다. 대화 뒤의 음악을 없애려는 목적이라면 배경음악 제거 가이드를 먼저 보세요.
01. 녹음 상태에 맞는 방법 선택하기
보유한 자료 | 시작 방법 | 주요 한계 |
|---|---|---|
원본 마이크 또는 녹음 트랙 | 필요한 사람의 원본 트랙만 재생하고 내보내기 | 다른 사람의 목소리가 해당 마이크에 함께 녹음됐을 수 있습니다. |
번갈아 말하는 혼합 녹음 | 타임라인에서 불필요한 발화 구간을 자르거나 음소거 | 동시에 말하는 목소리는 이 방법으로 분리되지 않습니다. |
발화가 겹치는 혼합 녹음 | 짧은 구간에서 화자별 분리 시도 | 단어 누락과 다른 목소리가 남는지 확인해야 합니다. |

방법 선택을 돕는 도식이며, 제품 화면이나 성능 측정 결과가 아닙니다.
상황 1: 원본 트랙이 있는 경우
원본 녹음 프로젝트에서 필요한 사람의 마이크 트랙만 재생하세요. 다른 사람의 소리가 마이크에 함께 들어왔는지 확인한 뒤 사용할 수 있는 트랙을 내보내세요. 완성된 혼합 파일에서 목소리를 복원하는 과정을 줄일 수 있습니다.
스테레오 파일의 두 채널이 반드시 서로 다른 사람을 뜻하지는 않습니다. 왼쪽과 오른쪽 채널을 각각 들어본 뒤 독립된 화자 트랙인지 판단하세요.
상황 2: 화자가 번갈아 말하는 경우
일부 발화만 필요하다면 타임라인 편집으로 충분할 수 있습니다. 필요한 사람의 구간은 남기고 나머지 구간의 음량을 낮추거나 음소거하세요. 각 단어의 시작과 끝을 보존하고, 편집 지점마다 주변 소리가 갑자기 바뀌지 않는지 확인하세요.
예를 들어 질문과 답변에서 게스트만 나오는 클립을 만들 때는 답변만으로도 의미가 통하는 경우에만 질문을 삭제하세요. 질문을 빼면 뜻이 달라지는 경우 맥락을 유지해야 합니다.
상황 3: 두 목소리가 동시에 겹치는 경우
겹치는 시간대를 음소거하면 두 사람의 소리가 모두 사라집니다. 대신 짧은 구간에 화자별 분리를 적용하고, 같은 시점의 각 출력을 원본과 비교하세요.
중요한 문장이 누락됐다면 다른 테이크를 쓰거나 원본 마이크 트랙을 요청하거나, 끼어들기가 없는 구간을 선택하세요. 트랙 두 개가 나왔다고 모든 단어가 복원됐다고 가정하지 마세요.
02. 화자 표시와 분리된 오디오 트랙은 다릅니다
화자 분할은 전사문에서 누가 언제 말했는지 표시하는 기능입니다. 예를 들어 Google Cloud의 화자 분할 문서는 인식된 단어에 화자 표시를 붙이는 방식을 설명합니다. 이것만으로 한 사람의 목소리만 담긴 다운로드용 파일이 생기지는 않습니다.
화자별 음성 분리는 개별 음성 트랙을 만드는 것을 목표로 합니다. 도구를 선택하기 전에 실제 출력 형식을 확인하세요. Speaker 1과 Speaker 2가 표시된 전사문은 텍스트 편집에는 도움이 되지만 원본 오디오는 여전히 섞여 있을 수 있습니다.
보컬 트랙도 다른 개념입니다. 배경음이 줄어든 상태로 두 사람의 음성을 모두 담을 수 있습니다. 자세한 내용은 음악용 보컬 제거와 영상 음성 분리의 차이를 참고하세요.
03. Perso Dubbing에서 화자별 트랙 확인하기
1. 대표적인 짧은 구간 선택
각 사람이 또렷하게 말하는 문장과, 있다면 끼어들기 구간을 포함하세요. 비교용 원본을 보관하세요. 쉬운 첫 문장만으로는 가장 복잡한 부분의 사용 가능 여부를 판단할 수 없습니다.
2. 파일 업로드
Perso Dubbing 음성 분리의 업로드 영역을 이용하세요. 처리 전에 현재 표시된 파일 요건과 체험 조건을 확인하세요.
3. 필요한 출력 찾기
처리 후 제공되는 트랙을 확인하세요. 한 사람의 목소리가 필요하면 개별 화자 트랙을 찾으세요. “All Speakers (Vocals)”는 한 사람이 아닌 모든 화자의 음성을 뜻합니다.
번호별 트랙을 들어보고 누구의 목소리인지 확인하세요. Speaker 1이 항상 진행자라고 생각하거나, 검출된 트랙을 곧바로 게시할 수 있다고 가정하지 마세요.
4. 어려운 구간 비교
끼어들기 전후의 원본과 각 화자 트랙을 재생하세요. 이어서 조용한 문장과 단어 끝부분을 확인하세요. 아래 체크리스트로 편집에 쓸 수 있는지 판단하세요.
5. 내보낸 뒤 영상 편집기로 이동
내보내기 메뉴에는 화자별 WAV 파일이 표시됩니다. 9월 29일 점검 시 다운로드 안내에는 Starter 플랜에서 트랙 다운로드를 제공한다고 표시됐습니다. 회원가입만으로 무료 다운로드가 가능하다고 가정하면 안 됩니다. 로그인된 작업공간의 Audio Export는 선택한 트랙을 하나로 합칩니다. 한 화자만 내보내려면 다른 트랙을 해제하고 Selected 표시가 해당 화자만 보여주는지 확인하세요. 영상 제작 시 이 오디오를 편집기에 넣고 원본과 시간을 맞춘 뒤, 원본 혼합 오디오는 음소거해 다른 목소리가 다시 섞이지 않게 하세요.
최종 영상 내보내기 전에 시작 부분과 뒤쪽의 싱크를 확인하세요. 이 과정에서 음성 분리와 영상 내보내기는 별도 단계입니다.
04. 결과를 사용하기 전 들어볼 항목
확인 항목 | 주의해서 들을 부분 | 대응 |
|---|---|---|
필요한 말 | 음절·자음 누락 또는 의미 변화 | 원본의 같은 문장과 비교하세요. 중요한 단어가 사라졌다면 사용하지 마세요. |
다른 화자 | 선택한 목소리 아래 남아 있는 다른 사람의 소리 | 편집 방식 변경이나 원본 개별 녹음이 필요한지 판단하세요. |
끼어들기 | 동시에 말할 때 작아지거나 왜곡되는 음성 | 겹치는 구간과 번갈아 말하는 구간을 따로 검수하세요. |
음색 | 금속성 소리, 갑작스러운 변화, 불균일한 음량 | 헤드폰과 시청자가 사용할 기기에서 들어보세요. |
타이밍 | 입 모양보다 빠르거나 느린 발화 | 트랙 정렬과 편집 중 잘라낸 부분을 확인하세요. |
깨끗한 한 구간을 들었다고 전체 녹음이 검증되는 것은 아닙니다. 짧은 인터뷰에서는 깨끗한 몇 분보다 손상된 답변 하나가 더 중요할 수 있습니다.
05. 겹치는 발화에서 확인할 한계
내부 테스트에서 합성 음성 두 개로 약 19초 녹음을 만들고 두 번째 음성을 6.5초에 시작했습니다. 로그인된 작업공간은 두 화자 선택지, 화자가 표시된 전사문, 원본과 거의 같은 길이의 WAV 두 개를 제공했습니다.
그러나 Speaker 2 출력의 6.5~10초는 디지털 무음이었습니다. 따라서 파일 두 개가 나왔다는 사실만으로 겹친 목소리가 완전히 복원됐다고 볼 수 없습니다. 청취 검수와 음성·트랙 대응 확인은 완료하지 않았습니다. 이는 합성 샘플 하나의 신호 수준 관찰이며, 실제 인터뷰 벤치마크나 분리 성공 시연이 아닙니다.
실무에서는 필요한 모든 문장을 원본과 비교하세요. 특히 서로 끼어드는 부분을 확인해야 합니다. 파일 전체 길이가 유지돼도 그 안의 발화는 누락될 수 있습니다.
06. 목소리가 계속 겹쳐 들린다면
분리 결과는 자신의 파일로 평가해야 합니다. 필요한 말이 사라졌거나 다른 목소리가 방해된다면 다른 구간, 원본 마이크 녹음, 가능하다면 재녹음을 고려하세요. 손상된 문장을 실제 발언의 정확한 기록으로 제시하지 마세요.
전사나 더빙에서는 소리뿐 아니라 화자 배정도 검토하세요. 분리된 오디오가 있다고 전사나 번역까지 정확한 것은 아닙니다. 다화자 전사 가이드는 화자 표시와 스크립트 검수를 설명합니다.
원본을 사용할 수 있는 상태가 되면 영상 더빙으로 넘어갈 수 있습니다. 음성 분리 검수와 번역 스크립트 검수는 별도로 판단하세요.
07. 자주 묻는 질문
Q. 동시에 말하는 두 목소리도 분리할 수 있나요?
A. 혼합 녹음에 화자별 분리를 시도할 수 있습니다. 각 출력의 겹치는 구간을 확인하세요. 화자 표시가 두 개 있다는 사실만으로 두 음성이 깨끗하게 보존됐다고 볼 수는 없습니다. 말과 소리를 비교할 원본을 보관하세요.
Q. 보컬 제거기로 인터뷰에서 한 사람만 분리할 수 있나요?
A. 도구에서 말하는 ‘보컬’의 의미를 확인하세요. 목소리와 음악을 나누는 출력에는 두 화자가 함께 남을 수 있습니다. 개별 화자 오디오 출력을 찾아 각각 들어보세요. 전사문의 화자 표시는 분리된 오디오 트랙과 다릅니다.
Q. 결과를 영상으로 다운로드할 수 있나요?
A. 여기서 설명한 화자 다운로드는 WAV 오디오입니다. 완성된 영상을 만들려면 선택한 오디오를 영상 편집기에 넣고 화면과 시간을 맞춘 뒤 원본 혼합 오디오를 음소거하세요. 9월 29일 확인한 다운로드 안내에는 Starter 플랜에서 트랙 다운로드를 제공한다고 표시됐습니다.
음성 분리에서 자신의 녹음을 테스트하세요. 전체 편집을 시작하기 전에 어려운 구간을 비교하세요.
계속 읽기
모두 보기
제품
솔루션
개발자
API
엔터프라이즈
솔루션
제품
솔루션
개발자
API
엔터프라이즈
솔루션





