La autenticación biométrica, a diferencia de las contraseñas o de la autenticación basada en tokens, utiliza características biológicas únicas para verificar la identidad de una persona. Es más difícil de falsificar y, en general, resulta más cómoda para los usuarios, ya que no tienen que recordar contraseñas ni llevar consigo un token físico que se puede perder o ser robado fácilmente. El autenticador forma parte de la propia persona.
El reconocimiento de voz (también denominado reconocimiento de hablante o autenticación por voz) utiliza el análisis de la voz de una persona para verificar su identidad. Las vías respiratorias y las cavidades de los tejidos blandos, así como la forma y el movimiento de la boca y la mandíbula, influyen en los patrones de la voz para crear una «huella vocal» única.
El reconocimiento de hablantes es un tipo de tecnología de reconocimiento de voz. Sin embargo, no es lo mismo que el reconocimiento de voz, que es la tecnología utilizada en aplicaciones de conversión de voz a texto y en asistentes virtuales como Siri o Alexa. El reconocimiento de voz puede interpretar el lenguaje verbal, pero no puede verificar la identidad del hablante basándose en sus atributos vocales únicos; la biometría de voz sí puede hacerlo.
Métodos de reconocimiento de hablantes
Existen dos enfoques principales para la autenticación por voz:
- Independiente del texto: La autenticación por voz se lleva a cabo utilizando cualquier frase de acceso pronunciada u otro contenido de voz.
- Dependiente del texto: Se utilizan las mismas frases de contraseña tanto en el registro como en la verificación. Esto significa que el hablante no puede decir lo que quiera para autenticarse, sino que se le pedirá que pronuncie una frase predeterminada. En la autenticación de voz dependiente del texto estática, se utiliza la misma frase de contraseña en cada verificación. En la autenticación de voz dependiente del texto dinámica, se genera una frase de contraseña aleatoria para el usuario, como una secuencia numérica. Este contenido también debe registrarse.
Inscripción y verificación
Para crear una plantilla de referencia con la que comparar las muestras en futuros intentos de autenticación, es necesario capturar y registrar una muestra biométrica de voz mediante un micrófono. A continuación, se analizan las características vocales únicas, tales como:
- Duración
- Intensidad
- Dinámica
- Tono
Casos de uso de la autenticación por voz
El principal caso de uso de la autenticación por voz es la autenticación móvil sin necesidad de utilizar las manos. Es ideal para teléfonos móviles u otros entornos en los que el reconocimiento facial, el reconocimiento de huellas dactilares y otras formas de autenticación biométrica resultan poco prácticos, como, por ejemplo, en los automóviles.
La autenticación por voz también resulta útil para dispositivos de reconocimiento de voz, como Google Home o Alexa de Amazon. Los asistentes virtuales se utilizan cada vez más para realizar pedidos y llevar a cabo otras funciones que suelen requerir algún tipo de autenticación.
El reconocimiento de voz también puede servir como método de autenticación durante las llamadas de atención al cliente. Los usuarios pueden encontrar esta opción más cómoda y segura que facilitar datos personales, como el número del carné de conducir o de la tarjeta de crédito, para verificar su identidad.
Ventajas y desventajas
El reconocimiento de voz presenta varias ventajas clave con respecto a otras formas de autenticación de identidad:
- Es una opción muy accesible para la autenticación en teléfonos móviles, ya que todos los teléfonos disponen de micrófono.
- Su integración en otros dispositivos, como automóviles y electrodomésticos, resulta rentable.
- Práctico y familiar para la mayoría de los usuarios.
- Sin contacto y, por lo tanto, menos invasivo y más higiénico.
- Útil para situaciones en las que se utiliza el teléfono, como la atención al cliente
Entre las desventajas del reconocimiento de voz se encuentran las siguientes:
- No es tan preciso como otras modalidades biométricas (por ejemplo, el reconocimiento facial).
- Requiere « liveness detection » para verificar que una muestra procede de un hablante en directo y no de una grabación.
- El ruido de fondo puede afectar a la calidad de la muestra y, a su vez, al rendimiento de la comparación.
- No es la opción ideal para todos los entornos (por ejemplo, espacios ruidosos o públicos).