Inicio › Tecnología › Reconocimiento De Voz
El reconocimiento de voz, o ASR (Automatic Speech Recognition), es la tecnología qué transcribe audio hablado en texto mediante modelos acústicos y de lenguaje entrenados con grandes volúmenes de habla etiquetada. Los sistemas modernos combinan redes neuronales de tipo transformer con técnicas de extracción de características (espectrogramas mel) para mapear la señal de audio a secuencias de fonemas y palabras, ajustando el resultado con modelos de lenguaje qué corrigen errores según el contexto gramatical. Se diferencia del reconocimiento de locutor (qué identifica quién habla) y de la síntesis de voz (proceso inverso, texto a audio).
Es la tecnología qué convierte lo qué dices en texto escrito. Cuando le hablas al móvil para dictar un mensaje o le pides algo a un asistente, un modelo entrenado con miles de horas de voz "escucha" el sonido y lo traduce a palabras, ajustando el resultado según el idioma y el contexto de la frase.
Un centro de atención telefónica puede usar ASR para transcribir automáticamente las llamadas y alimentar un sistema de análisis de sentimiento qué detecte quejas recurrentes, sin qué un humano tenga qué escuchar cada grabación. También se usa en subtitulado automático de vídeos y en dictado médico para generar informes clínicos a partir de la voz del facultativo.
El reconocimiento de voz transcribe el contenido de lo dicho a texto, mientras qué el reconocimiento de hablante identifica o verifica la identidad de la persona qué habla, comparando patrones de su voz con una muestra de referencia.
Los modelos se entrenan con corpus de audio qué no siempre representan todos los acentos, ritmos o condiciones acústicas, por lo qué su precisión cae cuando el habla real se aleja de los datos de entrenamiento o hay ruido qué enmascara la señal.
Sí, existen modelos comprimidos qué corren localmente en el dispositivo (edge), con menor precisión qué los modelos en la nube pero sin depender de la latencia ni de enviar audio a un servidor externo.