Empieza por lo que creas: interpretaciones emotivas, contenido para el público local, tu propia voz o narración estable. Las puntuaciones de las tarjetas usan el mismo conjunto de vídeos internos.
Drama, entretenimiento e interpretaciones emotivas
Nightingale
Para creadores y estudios que buscan una interpretación prémium en los cambios de emoción. Nightingale obtiene la mayor media de seguimiento de la expresión original en los dos idiomas evaluados.
Vídeos internos · Seguimiento de la expresión: EN 0.45, KO 0.54. Estas puntuaciones miden la intensidad vocal, no la calidad general.
Clases, vídeos corporativos y públicos locales
Oriole
Un acento que suena natural al público local, según la evaluación auditiva. Elige Oriole para clases y vídeos corporativos que necesitan una voz consistente entre frases.
Vídeos internos · Consistencia de voz en inglés: 0.661, la mayor media. En coreano lidera Wren.
Tu voz, entrevistas y producción a gran escala
Finch
Para creadores que quieren conservar su voz al doblar entrevistas o un canal completo. Finch obtuvo la mayor media de similitud de voz en inglés y está diseñado para conservar la voz con un coste de producción bajo.
Vídeos internos · Similitud de voz en inglés: 0.564. Su foco es conservar la voz con un coste bajo; revisa el acento en inglés y español antes de publicar.
Clases, narración corporativa y lectura estable
Wren
Para educadores y empresas que buscan una narración estable. Wren se adapta a guiones de clases, presentaciones corporativas y lectura en voz alta, con la mayor media de consistencia de voz en coreano en los vídeos internos.
Vídeos internos · Consistencia de voz en coreano: 0.713. Naturalidad prevista en inglés: 3.64/5, una puntuación automática, no una evaluación auditiva.
Dodo es el modelo Expressive anterior y se incluye como contexto en la evaluación. La disponibilidad y las condiciones de uso de los modelos se muestran en el producto.
Cómo evaluamos el doblaje
La calidad del doblaje tiene varias dimensiones. Evaluamos a quién se parece la voz, cómo sigue la expresión original y con qué consistencia se mantiene en una escena. También examinamos la traducción, los errores de reconocimiento de voz y la sincronización temporal.
01
Identidad vocal
¿La voz doblada sigue pareciéndose a la del hablante original?
Similitud con la voz original
02
Expresión
¿La intensidad vocal sigue la interpretación original?
Correlación de activación vocal · Análisis de tono
03
Consistencia
¿La voz generada se mantiene coherente entre frases?
Similitud vocal entre frases consecutivas
Evaluación de ingeniería · 22 de septiembre de 2026
Explora las mediciones.
Selecciona un conjunto de datos, un idioma de destino y una métrica para comparar los modelos. Las puntuaciones usan la escala y las condiciones indicadas para cada métrica.
| Modelo | 00.250.50.751 | Media |
|---|---|---|
| Wren | 0.341 | |
| Dodo | 0.353 | |
| Oriole | 0.323 | |
| Finch | 0.564 | |
| Nightingale | 0.414 |
Fuente: benchmark del equipo de ingeniería de Perso, corregido el 22 de septiembre de 2026. Las filas resaltadas tienen la mejor media en la métrica seleccionada; los empates se resaltan juntos. No implica significación estadística ni superioridad general.
Finch tiene la mayor media en los cuatro idiomas de destino del habla leída pública y en los vídeos internos en inglés. En los vídeos internos en coreano, Nightingale obtiene 0.486 y Finch 0.483; los resultados son cercanos.
Condiciones de evaluación
Habla leída pública: 13 pares de idiomas, con originales en coreano, inglés, portugués y chino y destinos en inglés, español, portugués y coreano. Resultados promediados por grupo de lectores. Vídeos internos: 29 pares de doblaje, 16 al inglés y 13 al coreano.
En FLEURS, Wren, Dodo, Oriole y Finch reciben transcripción y tiempos y comparten una traducción fija. Nightingale realiza el reconocimiento de voz y la traducción. Los cuatro primeros se puntúan a partir de clips limpios por frase; la salida de Nightingale se separa de otros sonidos y se alinea con las ventanas de las frases originales. En los vídeos internos, cada modelo traduce por su cuenta. El error de reconocimiento se evalúa sobre pistas completas para todos los modelos de ese conjunto.
Los datos públicos de habla leída tienen licencia CC BY 4.0. Los resultados abarcan idiomas y contenidos seleccionados, no todos los escenarios de producción. No se calcula una clasificación global de modelos.
Las puntuaciones de las tarjetas proceden de un único conjunto de vídeos internos. El explorador también incluye datos públicos de habla leída. La evaluación auditiva aporta evidencia independiente sobre la calidad del acento.
13
Pares de idiomas de FLEURS
Datos públicos de habla leída. Orígenes: coreano, inglés, portugués y chino. Destinos: inglés, español, portugués y coreano. 64 frases por idioma de origen, agrupadas por lector. CC BY 4.0.
29
Pares de vídeos internos
Un conjunto independiente de vídeos similares al contenido de clientes, con 16 pares de doblaje al inglés y 13 al coreano. Evalúa contenido con tiempos más ajustados y condiciones de audio más variadas.
Qué pueden indicarte estos resultados
En FLEURS, Wren, Dodo, Oriole y Finch reciben transcripciones y tiempos, con una traducción compartida. Nightingale realiza su propio reconocimiento de voz y traducción. Son resultados del proceso completo bajo condiciones documentadas, no una comparación controlada de TTS aislado.
Evaluación auditiva: en el panel ciego de septiembre de 2026, Oriole tuvo la menor tasa de señalamientos de acento extranjero, un 8%. Es un resultado del panel de oyentes, no una puntuación automática de acento. Ninguna métrica representa por sí sola toda la experiencia auditiva.
Fuente: benchmark del equipo de ingeniería de Perso, corregido el 22 de septiembre de 2026. Tarjetas: vídeos internos, 16 pares de doblaje en inglés y 13 en coreano. Las pequeñas diferencias entre medias no demuestran una ventaja fiable. Consulta el consumo de créditos al usar el producto.
¿Prémium significa la mayor puntuación en todas las métricas?
No. Nightingale es nuestra oferta de motor prémium. Distintos modelos lideran distintas mediciones. La identidad vocal, la expresión, la traducción y los tiempos deben considerarse por separado.
¿Por qué separar las mediciones de la escucha?
Las métricas automáticas examinan señales específicas. No captan completamente la fluidez, los matices emocionales o si una interpretación encaja en una escena. Escuchar sigue siendo esencial.
¿Los idiomas evaluados representan todos los idiomas compatibles?
No. Los resultados de FLEURS abarcan cuatro idiomas de destino; el conjunto interno cubre inglés y coreano. No deben generalizarse a todos los idiomas o tipos de contenido.
Explora Perso Dubbing y elige el modelo adecuado para tu próximo proyecto.
Explorar Perso Dubbing →