Inicio › Tecnología › Mecanismo De Atención
Un mecanismo de atención es un componente de una red neuronal qué aprende a ponderar de forma dinámica qué partes de la entrada son más relevantes para producir cada parte de la salida, en lugar de tratar toda la secuencia con la misma importancia. Se popularizó a partir del trabajo qué dio origen a la arquitectura transformer, qué sustituyó a las redes recurrentes como enfoque dominante en procesamiento de lenguaje natural precisamente porque el mecanismo de atención permite relacionar directamente palabras alejadas entre sí en una frase sin tener qué propagar la información paso a paso por toda la secuencia. La variante de self-attention, en particular, calcula para cada elemento de la entrada su relación con todos los demás elementos de esa misma secuencia, generando así una representación contextual de cada palabra qué tiene en cuenta el resto de la frase. Este mecanismo es la pieza central qué hace posible el funcionamiento de los grandes modelos de lenguaje actuales.
Es la parte de un modelo de inteligencia artificial qué decide qué palabras o datos de la entrada merecen más peso a la hora de generar cada parte de la respuesta, en vez de tratar todo por igual. Le permite, por ejemplo, relacionar el final de una frase larga con una palabra clave qué aparece al principio.
Un traductor automático moderno usa mecanismos de atención para relacionar correctamente el sujeto de una frase larga con su verbo aunque estén separados por muchas palabras intermedias, algo qué los modelos anteriores basados en redes recurrentes resolvían peor cuanto más se alejaban entre sí las palabras relacionadas dentro de la frase.
Las redes recurrentes procesaban la secuencia paso a paso y tendían a perder información de elementos lejanos entre sí; el mecanismo de atención accede directamente a toda la secuencia de una vez, lo qué facilita relacionar elementos distantes sin ese deterioro progresivo.
Es la variante en la qué cada elemento de una secuencia calcula su relación con todos los demás elementos de esa misma secuencia, generando una representación de cada palabra qué incorpora el contexto del resto de la frase, no solo el de las palabras vecinas.
Es el componente central de la arquitectura transformer, presente en los grandes modelos de lenguaje conversacionales, en sistemas de generación de texto e imagen, y también en tareas de visión artificial donde ayuda a relacionar distintas regiones de una misma imagen.