Comece pelo que você produz: atuações emocionantes, conteúdo para o público local, sua própria voz ou narração estável. As pontuações dos cards abaixo usam o mesmo conjunto de vídeos internos.
Dramas, entretenimento e atuações emocionantes
Nightingale
Para criadores e estúdios que buscam uma entrega premium nas variações de emoção. O Nightingale lidera a média de acompanhamento da expressão original nos dois idiomas avaliados.
Vídeos internos · Acompanhamento da expressão: EN 0.45, KO 0.54. As pontuações medem a intensidade vocal, não a qualidade geral.
Aulas, vídeos corporativos e públicos locais
Oriole
Um sotaque que soa natural para o público local, segundo a avaliação auditiva. Escolha o Oriole para aulas e vídeos corporativos que exigem uma voz consistente entre frases.
Vídeos internos · Consistência de voz em inglês: 0.661, a maior média. Em coreano, o Wren lidera.
Sua voz, entrevistas e produção em escala
Finch
Para criadores que querem manter a própria voz ao dublar entrevistas ou um canal inteiro. O Finch teve a maior média de similaridade de voz em inglês e foi projetado para preservar a voz com baixo custo de produção.
Vídeos internos · Similaridade de voz em inglês: 0.564. O foco é preservar a voz com baixo custo; revise o sotaque em inglês e espanhol antes de publicar.
Aulas, narração corporativa e leitura estável
Wren
Para educadores e empresas que buscam uma narração estável. O Wren atende a roteiros de aulas, apresentações corporativas e leitura em voz alta, com a maior média de consistência de voz em coreano nos vídeos internos.
Vídeos internos · Consistência de voz em coreano: 0.713. Naturalidade prevista em inglês: 3.64/5, uma pontuação automatizada, não uma avaliação auditiva.
Dodo é o modelo Expressive anterior e está incluído no benchmark como contexto. A disponibilidade e as condições de uso dos modelos são informadas no produto.
Como avaliamos a dublagem
A qualidade da dublagem tem várias dimensões. Avaliamos com quem a voz se parece, como acompanha a expressão original e sua consistência ao longo de uma cena. Também examinamos tradução, erros de reconhecimento de fala e alinhamento temporal.
01
Identidade vocal
A voz dublada ainda se parece com a do falante original?
Similaridade com a voz original
02
Expressão
A intensidade vocal acompanha a interpretação original?
Correlação de ativação vocal · Análise de tom
03
Consistência
A voz gerada permanece coerente entre as falas?
Similaridade vocal entre falas consecutivas
Benchmark de engenharia · 22 de setembro de 2026
Explore as medições.
Selecione um conjunto de dados, um idioma de destino e uma métrica para comparar os modelos. As pontuações usam a escala e as condições indicadas para cada métrica.
| Modelo | 00.250.50.751 | Média |
|---|---|---|
| Wren | 0.341 | |
| Dodo | 0.353 | |
| Oriole | 0.323 | |
| Finch | 0.564 | |
| Nightingale | 0.414 |
Fonte: benchmark da equipe de engenharia da Perso, corrigido em 22 de setembro de 2026. As linhas destacadas têm a melhor média na métrica selecionada; empates são destacados juntos. Isso não implica significância estatística nem superioridade geral.
O Finch tem a maior média nos quatro idiomas de destino da fala lida pública e nos vídeos internos em inglês. Nos vídeos internos em coreano, o Nightingale marca 0.486 e o Finch 0.483; os resultados são próximos.
Condições de avaliação
Fala lida pública: 13 pares de idiomas, com fontes em coreano, inglês, português e chinês e destinos em inglês, espanhol, português e coreano. Resultados calculados por grupo de leitores. Vídeos internos: 29 pares de dublagem, 16 para inglês e 13 para coreano.
No FLEURS, Wren, Dodo, Oriole e Finch recebem transcrição e tempos e compartilham uma tradução fixa. O Nightingale faz o reconhecimento de fala e a tradução. Os quatro primeiros são avaliados com clipes limpos por fala; a saída do Nightingale passa por separação de voz e alinhamento às janelas das frases originais. Nos vídeos internos, cada modelo faz sua tradução. O erro de reconhecimento é avaliado em faixas completas para todos os modelos desse conjunto.
Os dados públicos de fala lida têm licença CC BY 4.0. Os resultados cobrem idiomas e conteúdos selecionados, não todos os cenários de produção. Não é calculado um ranking geral de modelos.
As pontuações dos cards vêm de um único conjunto de vídeos internos. O explorador também inclui dados públicos de fala lida. A avaliação auditiva oferece evidências separadas sobre a qualidade do sotaque.
13
Pares de idiomas do FLEURS
Dados públicos de fala lida. Origens: coreano, inglês, português e chinês. Destinos: inglês, espanhol, português e coreano. 64 frases por idioma de origem, agrupadas por leitor. CC BY 4.0.
29
Pares de vídeos internos
Um conjunto separado de vídeos semelhantes ao conteúdo dos clientes, com 16 pares de dublagem para inglês e 13 para coreano. Avalia conteúdo com restrições de tempo mais rígidas e condições de áudio mais variadas.
O que estes resultados podem mostrar
A avaliação FLEURS fornece transcrições e tempos ao Wren, Dodo, Oriole e Finch, com uma tradução compartilhada. O Nightingale faz seu próprio reconhecimento de fala e tradução. São resultados do processo completo em condições documentadas, não uma comparação controlada apenas de TTS.
Avaliação auditiva: no painel cego de setembro de 2026, o Oriole teve a menor taxa de apontamentos de sotaque estrangeiro, 8%. É um resultado do painel de ouvintes, não uma pontuação automatizada de sotaque. Nenhuma métrica isolada representa toda a experiência auditiva.
Fonte: benchmark da equipe de engenharia da Perso, corrigido em 22 de setembro de 2026. Pontuações dos cards: vídeos internos, 16 pares de dublagem em inglês e 13 em coreano. Pequenas diferenças nas médias não comprovam uma vantagem confiável. Confira o consumo de créditos ao usar o produto.
Premium significa a maior pontuação em todas as métricas?
Não. Nightingale é nossa oferta de motor premium. Modelos diferentes lideram medições diferentes. Identidade vocal, expressão, tradução e alinhamento temporal devem ser considerados separadamente.
Por que separar as medições da escuta?
As métricas automáticas examinam sinais específicos. Elas não captam totalmente a fluidez, as nuances emocionais ou se uma interpretação combina com a cena. Ouvir continua sendo essencial.
Os idiomas do benchmark representam todos os idiomas compatíveis?
Não. Os resultados do FLEURS aqui cobrem quatro idiomas de destino; o conjunto interno cobre inglês e coreano. Os resultados não devem ser generalizados para todos os idiomas ou tipos de conteúdo.
Explore o Perso Dubbing e escolha o modelo ideal para seu próximo projeto.
Explorar o Perso Dubbing →