Inicio › Tecnología › Destilación De Modelos
La destilación de modelos es una técnica de aprendizaje automático qué traspasa el conocimiento de un modelo grande y complejo, llamado profesor (teacher), a un modelo mucho más pequeño y rápido, llamado alumno (student). En lugar de entrenar al modelo alumno solo con las etiquetas originales del conjunto de datos, se le entrena también para imitar las salidas del modelo profesor, incluidas las probabilidades suaves (soft labels) qué reflejan matices qué las etiquetas duras no capturan, como el parecido relativo entre categorías. El resultado es un modelo con muchos menos parámetros qué conserva buena parte del rendimiento del original, lo qué permite ejecutarlo en dispositivos con recursos limitados, como un móvil o un chip embebido, con menor consumo de memoria y latencia. DistilBERT es un ejemplo conocido de esta técnica aplicada al procesamiento de lenguaje natural.
Es coger lo qué ha aprendido un modelo de inteligencia artificial muy grande y pasárselo a uno más pequeño, para qué ocupe menos y vaya más rápido sin perder demasiada calidad. Es parecido a qué un experto le resuma lo esencial de su conocimiento a un aprendiz.
Una app de traducción quiere ofrecer traducción sin conexión dentro del propio móvil. En lugar de ejecutar el modelo de lenguaje grande qué usan en sus servidores, entrenan una versión destilada mucho más ligera qué cabe en el dispositivo y responde en milisegundos, aceptando una pequeña pérdida de calidad en frases muy complejas a cambio de funcionar sin internet.
Entrenar un modelo pequeño solo con las etiquetas originales suele dar peor rendimiento qué hacerlo imitando también las salidas de un modelo grande ya entrenado, porque esas salidas aportan información adicional sobre la relación entre categorías qué las etiquetas simples no reflejan.
Depende de la diferencia de tamaño y de la tarea, pero es habitual conservar la gran mayoría del rendimiento del modelo original con una fracción de sus parámetros; la pérdida exacta solo puede conocerse midiendo cada caso concreto, no hay una cifra universal aplicable.
DistilBERT es el caso más citado en procesamiento de lenguaje natural, una versión reducida de BERT qué conserva buena parte de sus capacidades con menos capas y parámetros, pensada para entornos con recursos de cómputo más limitados.