saltar al contenido
Volver al glosario

término general

Diarización

La diarización es la parte de una transcripción automática que separa el audio por hablantes: responde a la pregunta «quién habló y cuándo», sin saber por sí misma quién es cada voz.

Un sistema de diarización detecta los cambios de voz y agrupa las intervenciones de cada hablante bajo una etiqueta, como «Persona 1» o «Persona 2»; ponerles nombre es un paso distinto. En condiciones reales es una tarea difícil: el habla solapada, las voces parecidas, el ruido o las intervenciones muy breves provocan errores, y las evaluaciones de investigación sobre audio difícil incluyen entrevistas clínicas. Su fiabilidad se mide con la tasa de error de diarización, que suma el habla que no se detectó, la que se detectó por error y la que se atribuyó a quien no era.

Ejemplo ficticio

En una sesión de pareja, las dos personas hablan a la vez durante una discusión. La transcripción atribuye a «Persona 2» una frase que dijo «Persona 1»; si no lo corriges, un resumen posterior puede atribuir esa frase a quien no la dijo.

Qué comprobar

  • Que el número de voces detectadas coincide con las personas que hablaron.
  • Los fragmentos con habla solapada o intervenciones muy cortas, donde aparecen más errores.
  • Que cada voz está asignada a la persona correcta antes de dar por buenos los análisis.

En nexmin

La transcripción separa las voces que detecta y la App propone a quién corresponde cada una, en «Asignación de voces». Puedes corregir la asignación o volver a transcribir indicando cuántas voces esperas, y después volver a generar los análisis.

Límite

Un error de diarización no se nota al leer el texto de corrido; solo se ve al contrastarlo con el audio o con tu recuerdo de la sesión.

Términos relacionados

Fuentes

Fuentes consultadas el 04/10/2026.

Última actualización: 2026-10-04