término general
Diarización
La diarización es la parte de una transcripción automática que separa el audio por hablantes: responde a la pregunta «quién habló y cuándo», sin saber por sí misma quién es cada voz.
Un sistema de diarización detecta los cambios de voz y agrupa las intervenciones de cada hablante bajo una etiqueta, como «Persona 1» o «Persona 2»; ponerles nombre es un paso distinto. En condiciones reales es una tarea difícil: el habla solapada, las voces parecidas, el ruido o las intervenciones muy breves provocan errores, y las evaluaciones de investigación sobre audio difícil incluyen entrevistas clínicas. Su fiabilidad se mide con la tasa de error de diarización, que suma el habla que no se detectó, la que se detectó por error y la que se atribuyó a quien no era.
Ejemplo ficticio
En una sesión de pareja, las dos personas hablan a la vez durante una discusión. La transcripción atribuye a «Persona 2» una frase que dijo «Persona 1»; si no lo corriges, un resumen posterior puede atribuir esa frase a quien no la dijo.
Qué comprobar
- Que el número de voces detectadas coincide con las personas que hablaron.
- Los fragmentos con habla solapada o intervenciones muy cortas, donde aparecen más errores.
- Que cada voz está asignada a la persona correcta antes de dar por buenos los análisis.
En nexmin
La transcripción separa las voces que detecta y la App propone a quién corresponde cada una, en «Asignación de voces». Puedes corregir la asignación o volver a transcribir indicando cuántas voces esperas, y después volver a generar los análisis.
Límite
Un error de diarización no se nota al leer el texto de corrido; solo se ve al contrastarlo con el audio o con tu recuerdo de la sesión.
Términos relacionados
Fuentes
- Tae Jin Park, Naoyuki Kanda, Dimitrios Dimitriadis, Kyu J. Han, Shinji Watanabe y Shrikanth Narayanan. A review of speaker diarization: Recent advances with deep learning. Computer Speech & Language, 72, 101317 (2022).
- Xavier Anguera y otros. Speaker Diarization: A Review of Recent Research. IEEE Transactions on Audio, Speech, and Language Processing, 20(2), 356-370 (2012).
- Neville Ryant y otros. The Third DIHARD Diarization Challenge. Interspeech 2021, 3570-3574 (2021).
Fuentes consultadas el 04/10/2026.
Última actualización: 2026-10-04